OpenAIは9月10日(米国時間)、ChatGPTの音声機能「ChatGPT Voice」を支える音声モデル「GPT-Live-1」を、開発者向けAPIとして一般提供開始したと発表しました。従来の音声対話システムは、ユーザーの発話が終わったタイミングを別の「ターン検出」モデルが判定し、そのうえで応答する仕組みでしたが、GPT-Live-1はこの検出モデルを介さず、聞くことと話すことを同時に行うフルデュプレックス方式を採用。話している最中の相づちや、話の割り込みにも人間同士の会話に近い自然さで対応できるとしています。
GPT-Live-1はあくまで音声のやり取りを担う「音声レイヤー」で、複雑な推論やツールの実行はGPT-6 Astra、Codex、ChatGPT Workといったバックエンドのモデルに委ねる設計です。想定用途として、電話を使った顧客対応・レストランの予約・来店予約の受付など、会話をしながらその場でタスクを完了させる「電話業務(テレフォニー)」向けの活用を特に打ち出しています。
料金体系にも変化があり、GPT-Live-1の音声レイヤーは分単位の定額$0.05/分で課金され、これとは別にバックエンドのモデルやツール、検索、ストレージ、電話回線などの利用料が加算されます。従来のRealtime API(gpt-realtime-2.1)が音声の入出力をトークン単位で従量課金していたのに比べ、料金体系がシンプルになった形です。ローンチ時点で12種類の音声(アクセント・方言・言語の違いを含む)が用意され、カスタム音声の利用には営業への問い合わせが必要だとしています。
出典: OpenAI



