2000種超の声と30秒の声コピー機能を備えて登場した
Google DeepMindが9月24日にGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを公開しました。Geminiシリーズの音声生成モデルです。もともと30種だったプリセット音声が2000種超に増えています。
オーストラリア訛りのDJや無機質なロボットなど個性の幅が広いです。30秒の録音データがあれば話者の声を再現できます。アクセントや感情の調子を自然言語で指定でき自分だけのキャラクターボイスも作れます。
第三者評価のHume AI Voice Design Benchmarkで71.4を記録し全体1位でした。Overall Quality IndexでもFlash TTSが1位でFlash-Lite TTSが2位です。前モデルのGemini 3.1 Flash TTSと比べて長文の朗読と2人の掛け合い制御が大きく改善されたとしています。
台本形式のAPIにも対応しています。キャラクターごとに声と演技の指示を分けて書けるのでオーディオドラマやゲームの台詞もまとめて生成できます。

- 9/24Gemini 3.8 Flash TTSとFlash-Lite TTSを公開し2000種超に拡大
- 9/24Simon Willison氏がPlaygroundを公開し生成費用2.74セントを実測
1分18秒の生成が20秒で費用は2.74セントだった
開発者のSimon Willison氏が公開当日にPlaygroundを作って試しました。2羽のペリカンが桟橋へ引っ越すか話し合う1分18秒の音声をFlash TTSで生成したところ約20秒で完成しています。費用は2.74セントでした。
台本はClaude 4.5 Opusに書かせたとWillison氏は説明しています。複数キャラクターの会話にAPIが対応しているためキャラクターごとに声と話し方を指定して1回で生成できます。
軽量版のFlash-Lite TTSを使えばさらに安くなります。品質と費用のどちらを優先するかで使い分けられます。
Gemini 3.8 Flash TTSの主な指標
| 項目 | 数値 |
|---|---|
| プリセット音声 | 2000種超(従来は30種) |
| 声コピーに必要な録音 | 30秒 |
| 1分18秒の生成時間 | 約20秒 |
| 1分18秒の生成費用 | 2.74セント(約4円) |
| Voice Design Benchmark | 71.4(全体1位) |
| Overall Quality Index | 1位(Flash)/ 2位(Flash-Lite) |
社内ナレーションの外注の形が変わりそうだ
1分の音声が3円ほどで作れるとナレーションの外注の形は変わります。社内研修の音声や製品紹介の動画に使えば外部のナレーターへ頼む回数を減らせます。ポッドキャストの仮録りにも向いています。
Google Vidsとも連携しており動画にそのまま音声を載せられます。Gemini Notebookから使えば資料の読み上げ音声も作れます。
ただし日本語の品質は未検証です。デモでは日本語のドラゴンキャラクターが紹介されていますが自然さの評価データは出ていません。Voice Arenaの多言語評価で上位に入ったとされるものの日本語の順位は明記されていません。導入前に日本語の品質は確かめたいところです。

Google AI Studioから今すぐ試せる
Google AI Studioのspeech generation機能から試せます。Gemini APIを使えば自社のアプリに組み込むこともできます。Gemini EnterpriseやGemini Notebookからも利用できます。
声の権利には注意が要ります。公式は「30秒のサンプルか利用権のある声」と明記しています。他人の声を無断で使うことは想定されていません。社内で展開するなら音声の利用ガイドラインを先に決めておくのが安全です。
- TTS
- テキストを音声に変換する技術。Text-to-Speechの略で音声合成とも呼ぶ。入力した文章を人の声のように読み上げる
- Voice Design Benchmark
- Hume AIが提供する音声モデルの品質評価。声のカスタマイズ性能やアクセント再現の正確さなどを第三者が測定する指標
1分の音声が3円ほどで作れるため社内研修の音声やプロモーション動画のナレーションを外注しなくて済む場面が増える。ただし声のコピー機能を社内で使うなら利用権のガイドラインが先に要る。公式も「権利のある声」と条件を付けている。日本語の品質は本番に入れる前に確認したい。デモに日本語キャラクターはあるが品質の評価データはまだ出ていない。
- Gemini 3.8 Flash TTSは日本語に対応しているか
- 対応しています。公式デモでは日本語のドラゴンキャラクターが紹介されています。Voice Arenaの多言語評価でも上位に入ったとされていますが日本語単体の品質評価データは公開されていません。Google AI Studioから無料で試せるので実際に確認するのがよいでしょう。
- 声のコピーに必要な条件は何か
- 30秒の音声サンプルが必要です。公式は「自分の声か利用権のある声」と条件を付けています。他人の声を無断で使うことは想定されていません。社内で使う場合は声の権利を確認したうえで利用ガイドラインを作っておくのが安全です。
- Flash TTSとFlash-Lite TTSの違いは何か
- Flash TTSがフル機能版でFlash-Lite TTSが軽量版です。Overall Quality IndexではFlash TTSが1位でFlash-Lite TTSが2位と品質に差があります。Flash-Liteのほうが費用は安くなります。品質と費用のどちらを優先するかで使い分けることになります。
この記事の出典
補助資料
- [1]Google DeepMindこの記事の元にした報道
出典の最終確認日:2026年9月24日
