本文へスキップ
MameTechNews
AI

Google、Gemini 3.5 Transcribeを公開 音声エージェント向け文字起こし

## POINTS

  • リアルタイムはLive API、録音はInteractions APIと用途でエンドポイントが分かれる
  • カスタム語彙とスマート整形により、社内用語や注文IDなどの取りこぼしを減らせる点が大きい
  • 公開プレビューのため、本番採用前に遅延とWERを自前データで必ず検証する必要がある

何が起きたか

Googleは2026年8月26日、Gemini 3.5 Transcribeを発表した。リアルタイム向けはLive APIのgemini-3.5-transcribe-live、録音向けはInteractions APIのgemini-3.5-transcribeで利用する。スマート文字起こし(言い直しやフィラーの整理)、カスタム語彙、85以上の言語自動検出、録音時の話者分離(最大3名、それ以上は実験的)などを備える。

背景

従来のASRは雑音や専門用語、言い直しで崩れることが多く、音声エージェントのボトルネックだった。GoogleはArtificial Analysis計測でストリーミングWER平均4.0%、非ストリーミング2.6%、最終文字起こしまでの時間はChirp 3比で70%改善と説明している。

エンジニアへの影響

ボイスUI、字幕、コール解析を自前で組むチームは、ASR単体から「整形済みテキスト+ツール呼び出し」前提の設計へ寄せられる。AntigravityやGboard、macOSのGeminiアプリにも展開が進むため、プロダクト面の体験変化も追う必要がある。