本文へ移動
NEWS
Gemini

30秒で声を作り2.74セントのGemini新TTSは日本語で鳴るか

読了 約5分
木目のテーブルに置かれたスマートフォンに「Welcome to the Gemini era」と表示されたGoogle DeepMindの画面。30秒で声を作り2.74セントのGemini新TTSは日本語で鳴るか
この記事の要点

Google DeepMindが音声生成モデル「Gemini 3.8 Flash TTS」と軽量版「Flash-Lite TTS」を公開した。2000種超のプリセットに加え30秒の録音から声を再現できる。1分18秒の音声が約20秒で生成され費用は2.74セントだった。

みんなの意見

30秒で声を作れるGemini TTSを仕事で使いますか

まだ回答がありません。最初の1票をどうぞ

SHARE
2000種超プリセット音声の数
30秒声コピーに必要な録音
2.74セント1分18秒の生成費用

2000種超の声と30秒の声コピー機能を備えて登場した

Google DeepMindが9月24日にGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを公開しました。Geminiシリーズの音声生成モデルです。もともと30種だったプリセット音声が2000種超に増えています。

オーストラリア訛りのDJや無機質なロボットなど個性の幅が広いです。30秒の録音データがあれば話者の声を再現できます。アクセントや感情の調子を自然言語で指定でき自分だけのキャラクターボイスも作れます。

第三者評価のHume AI Voice Design Benchmarkで71.4を記録し全体1位でした。Overall Quality IndexでもFlash TTSが1位でFlash-Lite TTSが2位です。前モデルのGemini 3.1 Flash TTSと比べて長文の朗読と2人の掛け合い制御が大きく改善されたとしています。

台本形式のAPIにも対応しています。キャラクターごとに声と演技の指示を分けて書けるのでオーディオドラマやゲームの台詞もまとめて生成できます。

Google DeepMind の公式ページ
Google DeepMind の公式ページ / 出典:deepmind.google / 制作:AInformation
これまでの流れ
  1. 9/24Gemini 3.8 Flash TTSとFlash-Lite TTSを公開し2000種超に拡大
  2. 9/24Simon Willison氏がPlaygroundを公開し生成費用2.74セントを実測

1分18秒の生成が20秒で費用は2.74セントだった

開発者のSimon Willison氏が公開当日にPlaygroundを作って試しました。2羽のペリカンが桟橋へ引っ越すか話し合う1分18秒の音声をFlash TTSで生成したところ約20秒で完成しています。費用は2.74セントでした。

台本はClaude 4.5 Opusに書かせたとWillison氏は説明しています。複数キャラクターの会話にAPIが対応しているためキャラクターごとに声と話し方を指定して1回で生成できます。

軽量版のFlash-Lite TTSを使えばさらに安くなります。品質と費用のどちらを優先するかで使い分けられます。

Gemini 3.8 Flash TTSの主な指標

項目 数値
プリセット音声 2000種超(従来は30種)
声コピーに必要な録音 30秒
1分18秒の生成時間 約20秒
1分18秒の生成費用 2.74セント(約4円)
Voice Design Benchmark 71.4(全体1位)
Overall Quality Index 1位(Flash)/ 2位(Flash-Lite)
データ:Google DeepMind 公式ブログ / Simon Willison / 制作:AInformation

社内ナレーションの外注の形が変わりそうだ

1分の音声が3円ほどで作れるとナレーションの外注の形は変わります。社内研修の音声や製品紹介の動画に使えば外部のナレーターへ頼む回数を減らせます。ポッドキャストの仮録りにも向いています。

Google Vidsとも連携しており動画にそのまま音声を載せられます。Gemini Notebookから使えば資料の読み上げ音声も作れます。

ただし日本語の品質は未検証です。デモでは日本語のドラゴンキャラクターが紹介されていますが自然さの評価データは出ていません。Voice Arenaの多言語評価で上位に入ったとされるものの日本語の順位は明記されていません。導入前に日本語の品質は確かめたいところです。

Gemini 3.8 Flash TTSで音声を作る流れ。1. 2000種超のプリセットから選ぶか30秒の録音で声を作る。2. テキストとスタイル指示を入力。複数キャラクターの会話もOK。3. 1分18秒が約20秒で完成。費用は2.74セント。データ:Google DeepMind 公式ブログ。制作:AInformation。
Gemini 3.8 Flash TTSで音声を作る流れ / データ:Google DeepMind 公式ブログ / 制作:AInformation

Google AI Studioから今すぐ試せる

Google AI Studioのspeech generation機能から試せます。Gemini APIを使えば自社のアプリに組み込むこともできます。Gemini EnterpriseやGemini Notebookからも利用できます。

声の権利には注意が要ります。公式は「30秒のサンプルか利用権のある声」と明記しています。他人の声を無断で使うことは想定されていません。社内で展開するなら音声の利用ガイドラインを先に決めておくのが安全です。

この記事に出てくることば
TTS
テキストを音声に変換する技術。Text-to-Speechの略で音声合成とも呼ぶ。入力した文章を人の声のように読み上げる
Voice Design Benchmark
Hume AIが提供する音声モデルの品質評価。声のカスタマイズ性能やアクセント再現の正確さなどを第三者が測定する指標
藤井俊太(AI導入コンサルタント)の見方

1分の音声が3円ほどで作れるため社内研修の音声やプロモーション動画のナレーションを外注しなくて済む場面が増える。ただし声のコピー機能を社内で使うなら利用権のガイドラインが先に要る。公式も「権利のある声」と条件を付けている。日本語の品質は本番に入れる前に確認したい。デモに日本語キャラクターはあるが品質の評価データはまだ出ていない。

よくある質問
Gemini 3.8 Flash TTSは日本語に対応しているか
対応しています。公式デモでは日本語のドラゴンキャラクターが紹介されています。Voice Arenaの多言語評価でも上位に入ったとされていますが日本語単体の品質評価データは公開されていません。Google AI Studioから無料で試せるので実際に確認するのがよいでしょう。
声のコピーに必要な条件は何か
30秒の音声サンプルが必要です。公式は「自分の声か利用権のある声」と条件を付けています。他人の声を無断で使うことは想定されていません。社内で使う場合は声の権利を確認したうえで利用ガイドラインを作っておくのが安全です。
Flash TTSとFlash-Lite TTSの違いは何か
Flash TTSがフル機能版でFlash-Lite TTSが軽量版です。Overall Quality IndexではFlash TTSが1位でFlash-Lite TTSが2位と品質に差があります。Flash-Liteのほうが費用は安くなります。品質と費用のどちらを優先するかで使い分けることになります。

この記事の出典

補助資料

  • [1]Google DeepMindGoogle DeepMind・補助的な二次資料・確認 2026-09-24この記事の元にした報道

出典の最終確認日:2026年9月24日

SHARE

広告を載せており、そこから申し込みがあると紹介料を受け取ることがあります。

この記事に出てくるAIも、まとめて比べられます 493本のAIツールを、やりたいこと・料金・日本語対応で絞り込めるデータベースです。5日ごとに料金を取り直しています。 AIツールを探す

あわせて読みたいRELATED