Metaは2026年9月1日、Muse Voice Transcribeを公開した。Meta Superintelligence Labs初のリアルタイム音声知覚モデルで、ストリーミングASR、20人超のダイアライゼーション、エンドポインティングを同一モデルで処理する。多言語と文中コードスイッチに対応し、言語・キーワード・文脈バイアスで精度を上げる。
技術の要点
音声は80msチャンク(12.5Hz)で処理し、各チャンクで聞き続けるかテキストを出すかを決める。難易度に応じて遅延を変えるadaptive delayをRLで学習し、最終転写までの速度と精度のトレードオフを改善したと説明する。学習言語は70超、初期推奨は検証済み25言語。1時間超の長尺と20人超の話者にも後処理なしで対応すると主張し、Artificial AnalysisのストリーミングSTTなどで首位と報告している(2026年9月1日時点)。
提供面ではMeta Model API、Meta AI for Mac、Muse Codeで利用できる。Meta AIとMuse Codeの音声ディクテーションも同モデルに切り替わり、Fn長押しで任意アプリ上の作業と組み合わせられる。
実務への影響
音声エージェントや社内会議のリアルタイム字幕を設計するチームは、話者分離とエンドポイントを別サービスで組む必要性を再検討できる。API経由の遅延・価格・データ取り扱いをPoCで測り、既存ASRパイプラインとの差分を確認したい。