Googleは9月23日、音声合成モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表した。

文章で声の特徴を指定して新しい声を作り、台本の一行ごとに感情や話し方を調整できるモデルで、Flashは表現力を重視したコンテンツ制作向け、Flash-Liteは大量生成と低遅延を重視したモデルとして位置付けられている。

ElevenLabsやQwenも感情や話し方の指示に対応するなか、Googleは総合的な音声品質や日本語の自然さで高い評価結果を示した。ただし、評価項目を個別に見ると競合が上回る部分もあり、料金にも2026年末までという条件が付いている。

どのような声を、どのような作品やサービスで使うのかによって、適したモデルは変わる。

AD

声そのものを作り、台本の一行ごとに演技を調整する

Googleの発表が打ち出したのは、声そのものを作る機能と、その声をどう話させるかを細かく制御する仕組みの組み合わせだ。

声の特徴を文章で指定して人物やキャラクターの声を作り、保存した声を繰り返し利用できる。それぞれのせりふには感情や話す速さを指定でき、笑い声やため息、相づちなども加えられる。

モデル仕様によると、Flashは130言語、Flash-Liteは101言語に対応し、どちらにも日本語が含まれる。

Gemini APIとGoogle AI Studioで提供が始まり、FlashはGemini Notebook、Flash-LiteはGoogle Vidsにも展開される。Gemini EnterpriseでのAPI提供と、既存の声を調整するリミックス機能については今後提供される予定だ。

制作時には、既存の音声と、自分で作成した音声では、複数人の会話を生成する方法が異なる

APIガイドによると、既存の音声を使う場合、一度のリクエストで最大2人の会話を生成できる。一方、設計した声や複製した声を組み合わせる場合は、話者ごとに音声を生成し、その後でつなぎ合わせる必要がある。

独自キャラクター同士の会話を作る場合は、この編集工程まで含めて考える必要がある。

また、今回のTTSは、テキストを音声へ変換するためのモデルだ。相手の発言を理解し、返答内容そのものを考えるGemini Liveとは役割が異なる。

音声エージェントへ組み込む場合も、返答内容を生成するモデルと、それを音声に変換するTTSでは、料金や処理時間を別々に考える必要がある。

総合評価では上位でも、ElevenLabsが勝る項目もある

Googleが評価資料の2ページに掲載したHume AIの比較では、総合品質でGemini 3.8 Flash TTSが0.920、Flash-Liteが0.914を記録した。

掲載されたモデルの中では高い値だが、総合評価と個別項目は同じ尺度ではない。

Humeの説明によると、総合値は表現力と安定性をまとめた0〜1の指標で、個別の品質項目は1〜5の尺度で評価される。正答率を示す数字ではないため、百分率として読むことはできない。

モデル 総合品質 自然な抑揚の変化 複数話者 単一の演技指示への追従
Gemini 3.8 Flash TTS 0.920 4.58 4.14 4.34
Gemini 3.8 Flash-Lite TTS 0.914 4.51 4.10 4.32
Gemini 3.1 Flash TTS 0.783 3.95 3.60 4.31
ElevenLabs v3 0.706 5.00 3.85 3.89
ElevenLabs v3 Conversational 0.769 4.97 3.97
Cartesia Sonic 3.6 0.840 3.40 3.37
OpenAI gpt-4o-mini-tts 0.740 4.22
Inworld TTS-2 0.576 3.76 4.15

出典はGoogleが掲載したHume AIの評価で、2026年9月時点のもの。いずれも高いほど良い。「—」は評価値が掲載されていないことを示し、機能そのものが非対応という意味ではない。

Googleは自社モデルについて、実際に提供しているモデルと標準の生成設定を使い、一度の生成結果で評価したと説明している。

注目したいのは、ElevenLabs v3の「自然な抑揚の変化」だ。

この項目では、話し方の変化が単調すぎないか、逆に人間の発話として不自然なほど大げさになっていないかを評価する。総合品質ではGeminiを下回るElevenLabs v3が、この項目では5.00を記録している。

一方、Geminiの「単一の演技指示への追従」は、旧版の4.31から4.34への小幅な改善にとどまる。

総合品質の大きな伸びを、そのまま「あらゆる演技指示への対応能力が大幅に向上した」と解釈するべきではない。

声を作る機能についても、似た傾向が見られる。

同じ資料では、英語の総合評価でGeminiが71.4、ElevenLabs Voice Design v3が70.8となっている。一方、声質の評価ではGeminiが74.6、ElevenLabsが76.6となり、順位が逆転する。

これらの図には誤差幅が示されていないため、このわずかな差に統計的な意味があるかまでは判断できない。

作品に合った声を作れるかどうかと、台本の指示どおりに演技できるかどうかは、実際のせりふを使って別々に確かめる必要がある。

AD

日本語ではFlashがリード、Liteと旧版はほぼ同水準

Voice Arenaの日本語ランキングでも、Gemini 3.8 Flash TTSが高い評価を得ている。

9月24日時点で確認できた値は次のとおりだ。Googleの発表資料に掲載された時点とは数値が変化しているため、ここではVoice Arena上の最新値に統一している。

モデル 日本語Elo 表示された95%信頼区間
Gemini 3.8 Flash TTS 1209 ±21
Gemini 3.8 Flash-Lite TTS 1152 ±21
Gemini 3.1 Flash TTS 1148 ±10
ElevenLabs Eleven v3 1048 ±10
OpenAI gpt-4o-mini-tts 975 ±10

Eloは、モデル同士の音声を聞き比べた結果から算出される相対的な評価値であり、正答率や品質の倍率を示すものではない。

Flash-Liteと旧3.1 Flashについては、順位の範囲がどちらも2〜3位となっている。

日本語音声の自然さだけを見れば、Flash-Liteが旧版を明確に上回ったとまでは言えない。

評価方法では、各言語向けに用意された100文をモデル間で聞き比べ、どちらの音声がより人間らしく自然に聞こえるかを選ぶ。

標準のカタログ音声を使用し、声の複製機能は評価対象になっていない。また、言語ごとに独立して順位を算出しているため、日本語のEloと英語のEloを直接比較することもできない。

この結果は、日本語TTSの候補を絞る材料にはなる。

ただし、応答速度や生成費用、リアルタイム会話で利用者が割り込んだ際の反応などを評価したものではない。

長文ナレーションの制作と電話応対では、同じランキングを参考にするとしても、最終的に確かめるべき条件は異なる。

Qwenと比較するなら、TTS-FlashとTTS-Nextを分けて考える

Qwen Audio 3.1シリーズで、通常の文章読み上げに対応するのはQwen-Audio-3.1-TTS-Flashだ。

感情や話す速さを指定でき、ストリーミング生成と声の複製にも対応する。

機能面だけを見れば、感情や演技を指示できるTTSは、すでに各社が競争する主要な分野になっている。

モデル 日本語・言語対応 音声制作で使える主な機能 選定時に確認する点
Gemini 3.8 Flash TTS 日本語を含む130言語 声の作成、せりふ単位の演技、相づち カスタム音声による会話は話者別に生成して結合する必要がある
Gemini 3.8 Flash-Lite TTS 日本語を含む101言語 演技指示を利用した大量生成、低遅延処理 Flashとの品質差を実際の用途で確認する
Qwen-Audio-3.1-TTS-Flash 日本語対応。選択する声によって対応言語が異なる 感情・話速などの指定、声の複製、ストリーミング 日本語に対応する音声を選ぶ必要がある
Qwen-Audio-3.1-TTS-Next 公開API仕様では中国語・英語 音声と効果音、環境音をまとめて生成 非ストリーミング。通常の日本語読み上げとは用途が異なる
Eleven v3 日本語を含む74言語 感情や笑いの指定、複数話者による会話 実際の声と台本で演技の適合性を確認する

Qwenの音声一覧では、選択した音声が入力言語に対応していない場合、発音や自然さに問題が出る可能性があると説明されている。

モデル全体として「日本語対応」と書かれていても、すべての音声を日本語で同じように使えるわけではない。

さらに、TTS-NextのAPI仕様では、音声と効果音を組み合わせたコンテンツ生成に対応し、ポッドキャストでは一度に最大4分、それ以外では最大120秒の音声を生成できる。

Eleven v3も複数話者による表現に力を入れているが、生成対象や対応言語などの条件をそろえなければ直接比較することはできない。

Googleが掲載したHume AIの比較と、今回確認したVoice Arenaの日本語ランキングにはQwen Audio 3.1が含まれていない。そのため、これらの結果だけからGeminiとQwenの音質の優劣を判断することはできない。

AD

料金は2026年末までと、2027年以降を分けて見る

Gemini APIの標準有料料金では、Flashの音声出力が100万トークン当たり9ドル、Flash-Liteが6ドルとなっている。

ただし、この価格は2026年12月31日までの期間限定で、2027年1月1日からはそれぞれ18ドル12ドルになる予定だ。

  • 2026年9月確認の現行価格
  • 2027年1月からの予定価格
Gemini TTSの音声出力単価横棒グラフ。カテゴリ 3 件、系列: 2026年9月確認の現行価格, 2027年1月からの予定価格(単位: ドル/100万トークン)3.8 Flash TTS3.8 Flash TTS3.8 Flash TTS — 2026年9月確認の現行価格: 9ドル/100万トークン93.8 Flash TTS — 2027年1月からの予定価格: 18ドル/100万トークン183.8 Flash-Lite TTS3.8 Flash-Lite TT…3.8 Flash-Lite TTS — 2026年9月確認の現行価格: 6ドル/100万トークン63.8 Flash-Lite TTS — 2027年1月からの予定価格: 12ドル/100万トークン123.1 Flash TTS3.1 Flash TTS3.1 Flash TTS — 2026年9月確認の現行価格: 20ドル/100万トークン20単位: ドル/100万トークン
データを表で見る
2026年9月確認の現行価格 (ドル/100万トークン)2027年1月からの予定価格 (ドル/100万トークン)
3.8 Flash TTS918
3.8 Flash-Lite TTS612
3.1 Flash TTS20
Gemini TTSの音声出力単価標準有料枠の音声出力のみ。3.8の現行価格は2026年末まで。旧3.1の将来価格は表示しない。入力・再生成・割引を含まない。出典: Google Gemini Developer API pricing、2026年9月24日確認

Flash-Liteの音声出力料金は、旧3.1 Flash TTSと比べると、2026年末までは70%、2027年の予定価格でも40%低い。

旧版の現在価格である20ドルを基準に、それぞれ「1−6÷20」「1−12÷20」で算出した値だ。旧版の2027年以降の価格を予測した比較ではない。

入力料金とQwenの料金も加えると、次のようになる。

モデル・提供条件 入力100万トークン 出力100万トークン
Gemini 3.8 Flash TTS、2026年末まで 0.50ドル 9ドル
Gemini 3.8 Flash-Lite TTS、2026年末まで 0.50ドル 6ドル
Gemini 3.8 Flash TTS、2027年から予定 1.00ドル 18ドル
Gemini 3.8 Flash-Lite TTS、2027年から予定 1.00ドル 12ドル
Qwen-Audio-3.1-TTS-Flash、国際サイト・シンガポール 0.23ドル 1.87ドル

Qwenについては9月22日からの価格改定通知に基づく。

いずれもテキスト入力と音声出力の料金だが、同じトークン数が同じ長さの音声を意味するとは限らない

そのため、表の単価だけを割り算して、Qwenなら同じ音声を何割安く生成できると判断することはできない。

Googleは、音声1秒を25トークンとして計算すると明記している。

現在の標準料金で1時間の音声を生成すると、音声出力だけでFlashが0.81ドル、Flash-Liteが0.54ドルになる。

計算は「3,600秒×25÷100万×出力単価」。入力料金や再生成にかかる費用は含まれていない。また、この換算方法をQwenへそのまま適用することもできない。

継続的に使う場合は、料金だけでなく、作成した声をどう管理できるかも重要になる。

Googleの声の複製APIでは、同じ成人話者による10〜30秒の参照音声に加え、本人が別途録音した同意を示す音声が必要になる。

保存できるカスタム音声は1プロジェクト当たり最大200件で、有効期間は1年間。サーバー側に声を保存しない方式で使うキーは、7日間で期限を迎える。

Googleは生成された音声にSynthIDによる透かしを埋め込むとしているが、これは声の利用について本人の同意を得る手続きを不要にするものではない。

旧Gemini TTSから移行する場合も、単にモデル名を書き換えるだけでは済まない。

演技指示を原稿内から専用のメタデータへ移す必要があり、非ストリーミング出力の標準形式も生のPCMからWAVへ変更されているため、既存の処理側でも対応が必要になる。

日本語の長いナレーションを作るなら、Flashの自然さによって修正や再生成を減らせるか。大量の読み上げを行うなら、Flash-LiteやQwenでも必要な発音精度や声質を維持できるか。

採用を判断する際には、自社で実際に使う台本を用意し、同じ条件で生成したうえで、完成までにかかった時間と費用まで比較するのがよい。

声の作成や演技の調整を繰り返し使える制作フローへ組み込めれば、モデルの表現力を実際の制作効率につなげやすくなる。