本文へスキップ
MameTechNews
AI

Google、ゼロから声を作れるGemini 3.8 Flash TTSをAPI公開

## POINTS

  • Flashは声の設計、Liteは大量処理向け。用途と単価を見てモデルを使い分ける
  • LiveKitやPipecat、Vercel経由で、既存の音声エージェント基盤へ組み込める
  • 声の複製は本人の同意録音が必須。一部地域のAI Studioでは複製機能が使えない

Googleは2026年9月23日、テキスト音声合成モデルGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを発表した。Flash TTSは自然言語プロンプトで役柄・アクセント・声質を指定して新しい声を作る用途向け。Flash-Lite TTSは吹き替えや音声エージェントなど、大量処理とコスト効率を優先する。どちらもGemini APIとGoogle AI Studioで提供を開始した。

従来のTTSはプリセット声色の選択が中心だった。今回は2000以上の本番向けボイスに加え、30秒の参照音声から声を複製する機能、行単位の演技指示、2話者の台本演出、長時間生成での声質維持を前面に出している。開発者向けにはAgora、LiveKit、Pipecat、VercelがGemini API経由で対応するとされ、音声エージェントの実装経路が短くなる。

複製には参照話者本人の口頭同意録音が必要で、生成音声にはSynthID透かしとC2PA資格情報が付く。複製機能はイリノイ州、テキサス州、EEA、英国、スイス、インドのAI Studioでは使えない。Flash TTSはGemini Notebook、Flash-LiteはGoogle Vidsでも順次使える。企業向けAPIはGemini Enterpriseで近く提供予定とされており、本番音声エージェントを置くなら提供地域と同意フローを先に確認する。