何が起きたか
Googleは2026年8月26日、Gemini 3.5 Transcribeを発表した。リアルタイム向けはLive APIのgemini-3.5-transcribe-live、録音向けはInteractions APIのgemini-3.5-transcribeで利用する。スマート文字起こし(言い直しやフィラーの整理)、カスタム語彙、85以上の言語自動検出、録音時の話者分離(最大3名、それ以上は実験的)などを備える。
背景
従来のASRは雑音や専門用語、言い直しで崩れることが多く、音声エージェントのボトルネックだった。GoogleはArtificial Analysis計測でストリーミングWER平均4.0%、非ストリーミング2.6%、最終文字起こしまでの時間はChirp 3比で70%改善と説明している。
エンジニアへの影響
ボイスUI、字幕、コール解析を自前で組むチームは、ASR単体から「整形済みテキスト+ツール呼び出し」前提の設計へ寄せられる。AntigravityやGboard、macOSのGeminiアプリにも展開が進むため、プロダクト面の体験変化も追う必要がある。