Gemini 3.8 Flash TTSとは? 音声合成で何ができるか|声を文章で作り30秒で複製 日本語の聞き比べで首位

Googleは2026年9月23日、文章を音声で読み上げるAIモデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表しました。TTSはText-to-Speech(テキスト読み上げ)の略で、書いた文章をAIが人の声でしゃべってくれる技術のことです。スマートウォッチでも音声アシスタントがGoogleアシスタントからGeminiに置き換わったばかりで、Geminiの「声」は身近なものになりつつあります。

今回の新モデルでは、声そのものを言葉で注文して作れるようになり、セリフ1行ごとに「ささやくように」「ゆっくり」といった演技の指示も出せるようになりました。一般の人はGemini NotebookとGoogle Vidsで、開発者はGoogle AI StudioとGemini APIで、発表当日から順次使えるようになっています。この記事では、何ができるようになったのか、誰がどこで使えるのかを順番に紹介します。

Flash TTSは声の演出向け Flash-Lite TTSは大量の吹き替え向け

2つのモデルは、得意なことがはっきり分かれています。

Gemini 3.8 Flash TTSは、キャラクターの声づくりや細かな演出のためのモデルです。「こんな声で」と文章で指示するだけでまったく新しい声を作れ、ゲームやオーディオブック、ポッドキャストの登場人物に使うことを想定しています。演技の指示や話すペース、方言の切り替え、相づちまで細かく指定できます。

Gemini 3.8 Flash-Lite TTSは、たくさんの音声を低いコストで作るためのモデルです。大量の吹き替えや音声コンテンツの制作、問い合わせ窓口などで会話する音声エージェントに向けて調整されていて、トーンや話すペース、ニュアンスを調整できます。

Googleはこの2つを、音声翻訳の「3.5 Live Translate」や文字起こしの「3.5 Transcribe」などに続く、Geminiの音声モデルの最新版と位置づけています。

Gemini NotebookとGoogle Vidsなら誰でも使える 開発者はGoogle AI Studioから

どちらのモデルも2026年9月23日から順次提供が始まっています。使える場所は、一般ユーザー・開発者・企業で次のように分かれます。

使う人
Gemini 3.8 Flash TTS
Gemini 3.8 Flash-Lite TTS

すべての人
Gemini Notebookで提供
Google Vidsで提供

開発者
Gemini API、Google AI Studioで提供
Gemini API、Google AI Studioで提供

企業
Gemini EnterpriseのAPI経由で近日提供予定
Gemini EnterpriseのAPI経由で近日提供予定

Gemini Notebook

Google Vids

開発者向けには、Google AI Studioに新しい「オーディオ プレイグラウンド」も用意されました。文章で指示して新しい声を作ったり、自分の声を複製したりでき、作った声を2人の掛け合い用の台本エディタにそのまま取り込んで、セリフごとに演技を指示できます。

Google AI Studio(Gemini 3.8 Flash TTS)

Gemini API 音声生成のドキュメント

なお、料金や、各サービスで日本語の声がいつから選べるかは、今回の発表には書かれていません。

声を文章で注文して作れる 標準の30種類から2,000種類以上へ

これまでのGeminiの読み上げは、用意された30種類の標準音声から選ぶ形でした。Gemini 3.8 Flash TTSでは、声の選択肢が大きく広がります。

・声を一から作る:役柄やアクセント、声の特徴を文章で指定して、100以上の言語や方言でオリジナルの声を作れます。Googleのブログでは、火を吹くドラゴンや、地域独特のイントネーションを持つナレーターといった例が紹介されています。
・2,000種類以上の音声ライブラリ:メキシコのスペイン語、ケベックのフランス語、スコットランドの英語のような地域ごとの違いも含めて、すぐに使える声が2,000種類以上そろいます。
・声の複製:自分の声、または使う許可を得ている声の30秒ほどのサンプルから、同じ声を再現できます。
・保存して使い回す:作った声を保存しておけば、長く続くプロジェクトでも声の印象がぶれにくくなります。
・声のリミックス(近日提供予定):ライブラリの声を選んで、音色・ピッチ・話すペース・アクセントを微調整できる機能です。「語り口を柔らかくする」のように文章で指示できるとしています。

声の複製は悪用が心配になる機能ですが、Googleは同意の確認、SynthIDによる電子透かし、C2PAのクレデンシャル(作成元を示す情報)の3つで守る仕組みにしているとしています。詳しくは後半で紹介します。

セリフ1行ごとに演技を指示できる 数時間の長尺と2人の掛け合いにも対応

声を決めたあとは、どのセリフをどう言わせるかを細かく指示できます。ここはFlash TTSとFlash-Lite TTSの両方でできることです。

・1行ごとの演技指導:自分で演技の指示を書くこともできますし、「落ち着いたカスタマーサービス担当」「ささやくようなサスペンスの場面」といった台本上の指示から、Geminiにセリフ回しを任せることもできます。
・長い音声:数時間続く音声でも、声の質やペース、キャラクターらしさを保つとしています。ポッドキャストやオーディオブックづくりに向いています。
・2人の掛け合い:1つの台本から、2人の声をはっきり分けた自然な会話を作れます。
・笑い声や相づち:台本に「」(笑い声)、「」(ため息)、「」(息をのむ音)や、「|mhm|」「|yeah|」のような相づちを書き込むと、会話らしい間やリアクションを加えられます。

日本語の聞き比べ評価でGemini 3.8 Flash TTSがトップ

Googleは、外部の評価でも成績が良かったと説明しています。

AI企業Hume AIの音声デザインのベンチマークでは、Gemini 3.8 Flash TTSが総合1位(71.4)となり、アクセントの再現でも首位(60.8)だったとしています。

Hume AIの音声デザインのリーダーボード。Gemini 3.8 Flash TTSが総合71.4、アクセント60.8でElevenLabsとInworldを上回っている表

同じHume AIの総合品質インデックスでは、Flash TTSが1位、Flash-Lite TTSが2位です。前の世代のGemini 3.1 Flash TTSと比べても、長い音声や2人の掛け合いの台本制御などで大きく進化したとしています。

Hume AIの音声品質ベンチマーク。総合でGemini 3.8 Flash TTSが0.920、Flash-Lite TTSが0.914で1位と2位になっている表

日本のユーザーにとって気になるのは、人が音声を聞き比べてどちらが良いかを選ぶ「Voice Arena」の結果です。どのモデルか伏せたまま比べるこの評価で、Gemini 3.8 Flash TTSとFlash-Lite TTSは、日本語、ブラジルのポルトガル語、ベトナム語、現代標準アラビア語、メキシコのスペイン語、ヒンディー語などの主要言語でトップになったとしています。Googleが公開した表では、日本語はGemini 3.8 Flash TTSのスコアが最も高くなっています。

Voice Arenaの言語別ランキング表。日本語ではGemini 3.8 Flash TTSが1232で最も高いスコアになっている

Hume AI 音声デザイン ベンチマーク

Voice Arena TTSリーダーボード

声の複製には本人の同意録音が必要 生成した音声にはSynthIDの透かし

本物そっくりの声が作れると、なりすましや誤情報に使われないかが気になります。Googleは、声優やナレーターの権利を守り、AIで作った音声だと分かるようにするための仕組みを組み込んだとしています。

・同意の確認:声を複製する前に、元の話者と一致する声の持ち主本人が、声で同意を録音して提出する必要があります。
・SynthIDの電子透かし:Geminiの音声モデルで作ったすべての音声には、人の耳には聞こえない電子透かし「SynthID」が埋め込まれます。AIで作った音声であることを後から検出できるようにし、誤情報の広がりを防ぐ狙いです。
・C2PAのクレデンシャル:声の複製機能は、コンテンツの作成元を示すC2PAの仕組みでも守られているとしています。

安全性への取り組みは、Google DeepMindのモデルカードで詳しく説明されています。

SynthID(Google DeepMind)

Gemini 3.8 Audio モデルカード

まとめ

Gemini 3.8 Flash TTSとFlash-Lite TTSで、Geminiの読み上げは「決まった声を選ぶ」から「声を作って演技までつける」ものに変わりました。文章で声を注文でき、30秒のサンプルから自分の声も再現でき、セリフごとに笑い声や相づちまで入れられます。

一般ユーザーが試せるのは、Flash TTSならGemini Notebook、Flash-Lite TTSならGoogle Vidsです。開発者はGoogle AI StudioとGemini APIからすぐに使え、企業向けのGemini Enterpriseは近日提供予定です。音声のリミックス機能もこれから追加されます。声の複製には本人の同意録音が必要で、作った音声にはSynthIDの透かしが入るので、使うときはこうした仕組みも頭に入れておくと安心です。

Source: Google Japan Blog「Gemini 3.8 音声合成モデルを発表」

あわせて読みたい関連記事

Google AI Studioを使ったアイデアを募るGoogleのアワードも、10月下旬から始まります。

Google AI Challengeが10月下旬に開催|Google Japan 25周年でアイデアを公募 年齢もプログラミング経験も不問

Geminiに用事を任せるとどこまで動いてくれるのか、発表会のデモで確かめました。

Gemini Sparkで何が自動化できる? 同窓会の幹事を任せるデモを見てきた|端末の電源が切れていても動く

声で文章を書く側のAIも進化しています。言い直しまで反映されるPixel 11の音声入力はこちら。

Pixel 11のAI音声入力はどこまで賢い? 言い直しも反映される様子をデモで確認|Gboard文章作成ツールも

スマートウォッチやヘッドホンの音声アシスタントもGeminiに置き換わりました。

Googleアシスタントが9月4日で終了へ|Wear OSスマートウォッチやヘッドホンも対象、Geminiに置き換わる【海外ニュース】

会議や取材の音声を文字にしたい人は、AIボイスレコーダーのまとめも参考にしてください。

日本で買えるAIボイスレコーダー8選|文字起こし・議事録が一気に楽になる最新モデルまとめ

AIの最新ニュースや活用法はこちらにまとめています。

AI・生成AIの記事一覧

Geminiに関する記事はこちらから読めます。

Geminiの記事一覧

スマートウォッチの最新情報はトップページからどうぞ。

Smart Watch Life トップページ

 はじめての方・記事の探し方に迷った方へ
記事が多くて迷ったら、
記事の探し方ガイド
から目的別に読めます。

※本記事のリンクから商品を購入すると、売上の一部が販売プラットフォームより当サイトに還元されることがあります。掲載されている情報は執筆時点の情報になります。