Googleが音声合成AI「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」をリリース
親愛なる読者の皆さまへ。ご存じの通り価格高騰などの悪影響でサーバー運営がとても苦しい状態です。回線や台数を整理し見直せる部分は全て見直しましたが、やはりまだ危険水域です。このままだと1ページを10分割ぐらいして無理矢理PVを増やさざるを得なくなってしまいます。そこで、GIGAZINEの物理的なサーバーたちを、たった1円でも良いので親愛なる読者の皆さまに支援してもらえればとっても助かります!今すぐ寄付は上のボタンから! ・ これまでGIGAZINEを支援してくれたメンバーのリスト
Googleが音声合成・テキスト読み上げモデルの「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」をリリースしました。日本語を含む100以上の言語・方言に対応し、2000種以上の音声でテキストを読み上げさせることができます。 Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
Google has released Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS. Gemini 3.8 Flash TTS debuts at #1 on our Pronunciation Robustness Benchmark and #2 on our Provider Voice Arena Leaderboard Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS are @GoogleDeepMind 's latest Text… pic.twitter.com/4RnbbjO0fe
Gemini 3.8 Flash TTSは高度な処理向けのモデルで、自然言語によるプロンプトを使って完全に新しい声をゼロから作成し、ゲーム、オーディオブック、ポッドキャストなどで利用することができます。Gemini 3.8 Flash-Lite TTSは大量処理向けのモデルです。
以下がGemini 3.8 Flash TTSの動作を紹介する動画です。「もっと低い声がいい」といった人間の要望に応え、AIが適切な音声を提案します。 Create your own voices with Gemini 3.8 text-to-speech - YouTube
また、30秒間の音声サンプルを吹き込むことで声を再現する機能にも対応。テキストを自分の声で読み上げさせることができます。この音声再現には透明性確保のために話者による同意が必要となっているため、映画やアニメの音声をそのまま入力して再現するといったことはできないようになっています。 数時間続く連続音声でも高い音声品質や自然なペース、キャラクターの声質を維持したり、複数人で会話するような表現を行ったり、笑い声やため息、相づちなどのリアクションを行ったりすることも可能。 音声AIベンチマークのHume AIでは総合スコアで1位を獲得。
人間による選考を行うVoice Arenaでは、日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語(MSA)などで上位に位置しています。
安全対策として、Gemini Audioモデル全般と同様、生成されるすべての音声クリップにはSynthIDによる透かしが入ります。 これらのモデルは Google AI Studio で体験できます。
・関連記事 「Grok Voice Think Fast 2.0」が登場、文字起こしと音声対話の両方に対応 - GIGAZINE 音声クローンが可能な音声合成AI「Qwen-Audio-3.0-TTS」が登場、日本語対応でGemini超えの性能 - GIGAZINE Googleが日本語対応の音声合成AI「Gemini 3.1 Flash TTS」をリリースしたので使ってみた、音声タグで感情を制御可能 - GIGAZINE
この要約はメディアの公開フィードから5Newsが集約したものです。 文脈も含めた全文はgigazine.netにあります — コンテンツの権利はGIGAZINEに帰属します。