AIニュース

Meta、話者分離や発話終了検知までリアルタイムでこなす音声認識モデル「Muse Voice Transcribe」を発表

公開日: ・出典: Meta AI(公式モデルページ)

Metaの研究組織MSL(Meta Superintelligence Labs)は9月1日、リアルタイム音声認識に特化した新モデル「Muse Voice Transcribe」を発表した。ストリーミング形式の音声認識(ASR)に加え、20人を超える話者を区別する話者分離(ダイアライゼーション)や、発話の終わりを検知する機能を、後処理を挟まず単一のモデルで同時にこなせるのが特徴だとしている。

技術面では、単語ごとに聞き取りにかける時間の長さを状況に応じて変える「アダプティブ・ディレイ」という仕組みを採用し、聞き取りやすい発話は素早く処理する一方、聞き取りにくい単語ではより長い音声の文脈を使って精度を確保するという。学習には70以上の言語のデータを使い、9月1日時点で25言語が検証済み。1時間を超える音声にも対応し、文中・文間でのコードスイッチング(言語切り替え)も扱えるとしている。

Metaによれば、Muse Voice Transcribeは9月1日時点でArtificial Analysisのストリーミング音声認識部門のリーダーボードで首位にランクインした。提供はMeta Model API経由で、価格は音声1,000分あたり3ドル(1時間あたり約0.18ドル)。すでにMac版「Meta AI」のディクテーション機能やコーディングツール「Muse Code」の音声入力にも組み込まれている。

出典: Meta AI(公式モデルページ)

Xでシェア