AIニュース

OpenAI、フルデュプレックス音声モデル「GPT-Live-1」をAPI公開 分単位の新料金体系を導入

公開日: ・出典: OpenAI

OpenAIは9月10日(米国時間)、ChatGPTの音声機能「ChatGPT Voice」を支える音声モデル「GPT-Live-1」を、開発者向けAPIとして一般提供開始したと発表しました。従来の音声対話システムは、ユーザーの発話が終わったタイミングを別の「ターン検出」モデルが判定し、そのうえで応答する仕組みでしたが、GPT-Live-1はこの検出モデルを介さず、聞くことと話すことを同時に行うフルデュプレックス方式を採用。話している最中の相づちや、話の割り込みにも人間同士の会話に近い自然さで対応できるとしています。

GPT-Live-1はあくまで音声のやり取りを担う「音声レイヤー」で、複雑な推論やツールの実行はGPT-6 Astra、Codex、ChatGPT Workといったバックエンドのモデルに委ねる設計です。想定用途として、電話を使った顧客対応・レストランの予約・来店予約の受付など、会話をしながらその場でタスクを完了させる「電話業務(テレフォニー)」向けの活用を特に打ち出しています。

料金体系にも変化があり、GPT-Live-1の音声レイヤーは分単位の定額$0.05/分で課金され、これとは別にバックエンドのモデルやツール、検索、ストレージ、電話回線などの利用料が加算されます。従来のRealtime API(gpt-realtime-2.1)が音声の入出力をトークン単位で従量課金していたのに比べ、料金体系がシンプルになった形です。ローンチ時点で12種類の音声(アクセント・方言・言語の違いを含む)が用意され、カスタム音声の利用には営業への問い合わせが必要だとしています。

出典: OpenAI

Xでシェア

GPT-Live-1でOpenAIの音声APIはこう変わった

ChatGPT Voiceを支える音声モデルがAPIとして提供されたことで、開発者向け音声APIの応答方式と料金体系がどう変わったかをまとめました。

項目 これまで(Realtime API / gpt-realtime-2.1) GPT-Live-1(新API)
応答方式 「ターン検出」モデルが会話の区切りを判定し、話者が交代するタイミングで応答するターン制 検出モデルを介さず、聞く・話すを同時に行うフルデュプレックス方式。相づちや割り込みにも自然に対応
音声レイヤーの料金体系 音声トークン単位の従量課金(gpt-realtime-2.1は音声入力が100万トークンあたり32ドル、音声出力が64ドル) 音声レイヤーは分単位の定額0.05ドル/分(バックエンドのモデル・ツール利用料は別途加算)

※出典: OpenAI公式 / OpenAI API Pricing(公式)