OpenAIは、半導体大手Broadcomと共同で一から設計した大規模言語モデル推論専用チップ「Jalapeño」について、初めて公開ベンチマーク結果を発表した。検証には、SemiAnalysisが公開している推論性能の公開ベンチマーク「InferenceX」を用い、GPT-OSS 120B、DeepSeek R1(670B)、Kimi K2.5(1T)という3種類の異なるオープンモデルでJalapeñoベースのシステムと既存のNvidia製アクセラレータを搭載した比較対象システムを比較した。
発表によれば、3モデルを通じてJalapeñoはワットあたりのスループットで比較対象システムの1.5〜1.9倍、エンドツーエンドのレイテンシーで1.7〜3.6倍低い結果を記録した。チャットボットのような対話型ワークロードに限ると、応答速度は2.1〜4.1倍高速だったという。あわせて、Jalapeñoを搭載したノード1台あたりの消費電力は700Wで、比較対象としたNvidia製フラッグシップGPUシステム(1,400W)の半分に抑えられているとも報じられている。
OpenAIは推論コストの急増を経営上の重要課題と位置づけており、自社設計チップによって既存のGPUベンダーへの依存を下げつつ、モデル1回あたりの提供コストを引き下げる狙いがあるとみられる。今回はあくまで最初のベンチマーク結果の公開であり、Jalapeñoを用いた本番環境での提供時期など詳細は明らかにされていない。
出典: OpenAI公式ブログ



