AIニュース

xAI、音声認識モデル「Grok Voice Transcribe 2.0」を発表 精度は旧版の2倍に

公開日: ・出典: xAI公式

xAIは2026年9月18日、音声認識(文字起こし)モデルの最新版「Grok Voice Transcribe 2.0」を発表した。同社の音声基盤モデル「Grok Voice」をベースにしており、料金を据え置いたまま、旧版の「Grok Voice Transcribe 1.0」の約2倍の精度を実現したとしている。

xAIによれば、公開されているArtificial Analysisのリーダーボードでは、ストリーミング対応モデル32種の中で精度1位にランクインしたという。特に多言語での精度向上が今回の改良の目玉としている。料金体系は旧版と同一で、バッチ処理が音声1時間あたり0.10ドル、ストリーミングが1時間あたり0.20ドル。話者分離やタイムスタンプ、キーワード抽出も引き続き含まれる。

xAIは、Grok Voice Transcribe 2.0を近くSpeech-to-Text APIの既定モデルに切り替え、数週間以内に1.0を廃止する予定であることも明らかにした。移行期間中も旧版を使い続けたい利用者は、リクエストで「grok-voice-transcribe-1.0」を明示的に指定することで対応できるという。Grok Voiceは既に1日あたり数万件規模のカスタマーサポート通話や、数百万時間分の動画ナレーションの文字起こしに使われているほか、テスラ車載の音声アシスタントなど物理製品にも組み込まれている。

出典: xAI公式

Xでシェア

Grok Voice Transcribeの旧版との比較

xAI公式発表に基づく、Grok Voice Transcribe 1.0と2.0の主な違いをまとめました。

項目 Grok Voice Transcribe 1.0 Grok Voice Transcribe 2.0
精度 2.0と比較して約半分の精度水準 1.0の約2倍(特に多言語精度が向上)、Artificial Analysisのストリーミング部門で1位
料金(バッチ処理) 音声1時間あたり0.10ドル 音声1時間あたり0.10ドル(変更なし)
料金(ストリーミング) 音声1時間あたり0.20ドル 音声1時間あたり0.20ドル(変更なし)
Speech-to-Text APIでの扱い 数週間以内に廃止予定(継続利用にはモデル名の明示指定が必要) 近く既定モデルに設定予定

※出典: xAI公式(Introducing Grok Voice Transcribe 2.0)