本文へスキップ
MameTechNews
AI

Meta、リアルタイム音声認識Muse Voice Transcribeを公開

## POINTS

  • ASR・話者分離・エンドポイントを一体提供し、音声エージェントの部品点数を減らせる
  • コードスイッチと文脈バイアスに対応し、日英混在の実務会話向け検証にも向いている点
  • Meta Model APIとMac向け製品で即利用可。遅延とプライバシー条件を先に確認する

Metaは2026年9月1日、Muse Voice Transcribeを公開した。Meta Superintelligence Labs初のリアルタイム音声知覚モデルで、ストリーミングASR、20人超のダイアライゼーション、エンドポインティングを同一モデルで処理する。多言語と文中コードスイッチに対応し、言語・キーワード・文脈バイアスで精度を上げる。

技術の要点

音声は80msチャンク(12.5Hz)で処理し、各チャンクで聞き続けるかテキストを出すかを決める。難易度に応じて遅延を変えるadaptive delayをRLで学習し、最終転写までの速度と精度のトレードオフを改善したと説明する。学習言語は70超、初期推奨は検証済み25言語。1時間超の長尺と20人超の話者にも後処理なしで対応すると主張し、Artificial AnalysisのストリーミングSTTなどで首位と報告している(2026年9月1日時点)。

提供面ではMeta Model API、Meta AI for Mac、Muse Codeで利用できる。Meta AIとMuse Codeの音声ディクテーションも同モデルに切り替わり、Fn長押しで任意アプリ上の作業と組み合わせられる。

実務への影響

音声エージェントや社内会議のリアルタイム字幕を設計するチームは、話者分離とエンドポイントを別サービスで組む必要性を再検討できる。API経由の遅延・価格・データ取り扱いをPoCで測り、既存ASRパイプラインとの差分を確認したい。