Googleは2026年9月23日、テキスト音声合成モデルGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを発表した。Flash TTSは自然言語プロンプトで役柄・アクセント・声質を指定して新しい声を作る用途向け。Flash-Lite TTSは吹き替えや音声エージェントなど、大量処理とコスト効率を優先する。どちらもGemini APIとGoogle AI Studioで提供を開始した。
従来のTTSはプリセット声色の選択が中心だった。今回は2000以上の本番向けボイスに加え、30秒の参照音声から声を複製する機能、行単位の演技指示、2話者の台本演出、長時間生成での声質維持を前面に出している。開発者向けにはAgora、LiveKit、Pipecat、VercelがGemini API経由で対応するとされ、音声エージェントの実装経路が短くなる。
複製には参照話者本人の口頭同意録音が必要で、生成音声にはSynthID透かしとC2PA資格情報が付く。複製機能はイリノイ州、テキサス州、EEA、英国、スイス、インドのAI Studioでは使えない。Flash TTSはGemini Notebook、Flash-LiteはGoogle Vidsでも順次使える。企業向けAPIはGemini Enterpriseで近く提供予定とされており、本番音声エージェントを置くなら提供地域と同意フローを先に確認する。