もはや人間と区別できない日本語AIボイスを作れる、Googleの「Gemini 3.8 Flash TTS」とイレブンラボの「Eleven v4」完全解説!

YouTubeチャンネル「AI大学【AI&ChatGPT最新情報】」が、「もはや人間と区別できない日本語AIボイスを作れる、Googleの「Gemini 3.8 Flash TTS」とイレブンラボの「Eleven v4」完全解説!」と題した動画を公開した。動画では、人間と自然に会話するレベルにまで進化した最新の音声AIモデル2種の概要と、具体的な使い方を解説している。

近年、文章を機械的に読み上げるだけだった音声AIは、人間の自然な話し方や感情表現を再現できるように進化している。動画の冒頭でも「人間と自然に会話するAIへと進化しています」と、その劇的な変化が語られた。動画では、その代表例としてGoogleの「Gemini 3.8 Flash TTS」とElevenLabsの「Eleven v4」の2つのモデルを取り上げている。

Googleの「Gemini 3.8 Flash TTS」は、100以上の言語に対応し、2000種類以上のボイスを標準で備えるモデルだ。テキストからオリジナルの声を作ったり、自身の声をクローンしたりできるのが特徴である。また、生成された音声すべてに耳では聞こえない透かし(SynthID)が埋め込まれ、AI音声だと判別できる仕組みになっているという。「Google AI Studio」から無料で利用可能であり、画面左の「Playground」メニューから直感的に操作できる手順が紹介された。

一方、ElevenLabsの「Eleven v4」は、動画内で「最も表現豊かな音声モデル」と評されている。最大の特徴は、台本を声優のように読み解き、テキスト内に「笑う」「ささやく」といった指示(オーディオタグ)を書き込むだけで、そのまま音声に反映できる点にある。長い台本でも話すテンポや声の表現を一定に保つことが可能だという。こちらも公式の「ElevenCreative」ページから無料枠を使って試すことができる。

さらに動画後半では、それぞれのモデルでAPIを発行し、「Codex」や「Claude Code」といったAIエージェントと連携させ、音声入りの動画を生成する具体的な設定方法が実演された。

最新の音声AIは、無料枠を活用するだけで、誰もが手軽に高品質な日本語音声を生成できる環境が整いつつある。動画で紹介されたツールを試すことで、感情豊かなAIボイスを自身のコンテンツ作成に活かすための第一歩を踏み出せるだろう。