AIニュース

Google、最高精度をうたう新音声認識モデル「Gemini 3.5 Transcribe」を発表

公開日: ・出典: Google公式ブログ

Googleは2026年8月26日(現地時間)、公式ブログで新しい音声認識(音声からテキストへの変換)モデル「Gemini 3.5 Transcribe」を発表しました。従来の音声認識モデルが雑音や専門用語、話し言葉特有の言い直しへの対応に苦労しがちだったのに対し、Gemini 3.5 Transcribeは生の音声データを直接、整形済みの読みやすいテキストへ変換できるとしています。話者の話し方の癖や意図をくみ取り、独自の語彙にも対応するほか、話しながらの言い直しを自然に処理し、「えー」「あの」といったフィラー(つなぎ言葉)を取り除く機能も備えます。

Googleによれば、多言語音声認識のベンチマーク「FLEURS」において、ストリーミング(リアルタイム)方式で単語誤り率(WER)5.50%、非ストリーミング方式で5.04%を達成し、前モデルの「Chirp 3」から精度が向上したとしています。加えて、文字起こしが確定するまでの時間(レイテンシ)はChirp 3比で最大70%短縮されたと説明しており、料金体系もChirp 3の1分あたり0.016ドルから、Gemini 3.5 Transcribeでは1分あたり約0.005ドルへと引き下げられています。対応言語は85以上に及び、地域ごとの訛りや方言への対応、事前録音済み音声については最大3名までの話者を単語単位のタイムスタンプ付きで識別する機能(4名以上は実験的機能扱い)も持たせています。

展開は幅広く、Search Live、Gemini Live、Google ドキュメント、Keep、Gmail、Gemini アプリ、Gboardなど一般ユーザー向けの主要製品へ順次提供されるほか、開発者向けにはGoogle AI StudioやGoogle Antigravity経由でGemini APIから利用可能になります。法人向けにもGemini Enterprise Agent PlatformおよびGemini Enterprise for Customer Experienceを通じて提供される計画で、音声を起点とするAIエージェント活用をGoogleが本格的に後押しする姿勢がうかがえます。

出典: Google公式ブログ

Xでシェア

旧モデル「Chirp 3」との主な違い

Google公式発表および同社の価格体系に基づき、旧モデルとの違いをまとめました。

項目 Chirp 3(旧モデル) Gemini 3.5 Transcribe(新モデル)
音声1分あたりのAPI料金(list価格) 0.016ドル 約0.005ドル
文字起こしが確定するまでの時間 従来水準 同条件比で最大70%短縮(Google公表)

※出典: Google公式ブログ / 9to5Google