ElevenLabsは9月28日、音声合成モデル「Eleven v4」と、リアルタイム対話向けの「Eleven v4 Turbo」を発表した。日本語を含む90超の言語に対応し、台本に応じた感情表現に加え、長尺コンテンツでも話者の声を一貫して保つ能力を強化したという。v4は主にコンテンツ制作、Turboは音声エージェントなどリアルタイム用途を想定し、いずれもAPIから利用できる。
日本の制作者にとっては、日本語での表現力向上に加え、同じ話者の声を多言語コンテンツへ展開しやすくなる更新だ。一方、別の言語を話す際のアクセントや生成設定にも変更があるため、既存作品を移行する場合は事前の確認が必要になる。
台本に沿った演技と、長尺コンテンツでの声の一貫性
Eleven v4は、文章の文脈から感情や間を読み取り、複数の話者による会話も生成できる。9月29日の日本法人の発表では、日本語を重点的に改善した言語のひとつとして挙げている。発音の正確さだけでなく、リズムや話し方の自然さも改善したという。
演技を細かく指定したい場合は、台本の途中に音声タグを書き込める。笑う、ささやく、長めに間を置くといった話し方のほか、ドアが閉まる音や雨音などの効果音も指定できる。同社によれば、複数の指示を組み合わせた場合も、v3より安定して反映できるようになった。例えば、静かに話し始め、間を置いてから徐々に感情を強めるといった演出を、せりふと一緒に指定できる。
公式のモデル仕様と製品ページで、制作向けモデルの主な違いを比べると次のようになる。
| 比較項目 | Eleven v3 | Eleven v4 |
|---|---|---|
| 対応言語 | 70超 | 90超 |
| 1回の生成で扱える文字数 | 5,000文字 | 10,000文字 |
| 複数話者の対話 | 対応 | 対応し、会話の文脈に応じた表現を強化 |
| プロフェッショナルボイスクローン | 非対応 | 対応 |
1回に生成できる文字数は2倍になった。ただし、本を丸ごと一度に音声化できるわけではない。長文では複数回に分けて生成する必要があり、それぞれの音声をつないだときに声質や話し方の調子を保てるかが別の課題になる。
ElevenLabsは、複数回に分けた生成のつながりや、一部のせりふを作り直した際の声の一貫性も改善したとしている。例えばナレーションの一文だけを修正した際、その部分だけ別人のような声になれば、前後まで作り直す必要が出てくる。
声質や話し方を保ったまま一部だけを差し替えられるのであれば、長尺コンテンツを制作する際の負担を減らせる。短いデモを自然に聞かせる能力とは別の、実際の制作工程に直結する改善だ。
同じ声を別の言語で使うとアクセントはどうなるか
日本語で録音した声に英語の文章を読ませた場合、v4は元の話者らしい声質を保ちながら、英語として自然な発音やアクセントに近づける。日本法人もこれを多言語展開の特徴として説明しており、元の言語のアクセントをそのまま別言語へ持ち込む従来の挙動から変化している。
開発者向けの説明によると、参照音声と生成する音声が同じ言語なら元のアクセントを維持する。一方、異なる言語を生成する場合は、参照音声のアクセントを引き継ぐのではなく、生成先の言語として自然な発音を目指す。これは意図された仕様だ。
元のアクセントを別言語でも残すかどうかを切り替える機能については研究中で、提供時期は決まっていない。
企業の案内音声を各国向けに展開する場合には、同じ話者の声質を保ちながら、それぞれの言語を自然に話せることが利点になる。一方、アクセントまで含めて登場人物の個性を作っているゲームや物語では、発音の変化そのものが演出の変更になり得る。
声質が元の話者に近いことと、従来の作品と同じ印象になることは、分けて確認する必要がある。
短い録音から声を再現する「インスタントボイスクローン」については、同社は約10秒の音声からでも高い精度で声の特徴を捉えられるとしている。ただし、「10秒あれば常に十分」という意味ではない。開発者向け資料では、通常は1〜2分程度の音声を使うことを案内しており、雑音やひずみを含む録音は生成結果にも影響する。
日本法人は、声を利用するために必要な権利や許可を求めている。さらに高精度な「プロフェッショナルボイスクローン」では、本人が自分の声を作成し、確認する仕組みが用意されている。
既存のプロフェッショナルボイスクローンをv4で使う場合は、v4向けの追加学習も必要になる。
生成設定では、演技の一貫性を調整するStabilityと、参照音声への近さを調整するSimilarityを利用できる。一方、StyleとSpeedのスライダーは用意されておらず、読み上げを細かく制御するSSMLにも対応していない。
音声タグも、指定した内容が必ずそのまま反映されるわけではない。既存の台本や声をv4へ移せても、速度や間、演技の調整方法まで以前と同じとは限らない。
Turboの「約100ms」と「約150ms」は何が違うのか
Eleven v4 Turboについては、中央値で約100msの推論遅延が示されている。日本法人は、通信時間や大規模言語モデル(LLM)が回答を生成する時間を含まないと説明している。
つまり、利用者が話し終えてからAIの返答が聞こえてくるまでの時間が100msという意味ではない。
さらに英語版の発表では、リクエストを送ってから最初の音声が出力されるまでの時間として、中央値約150msという別の数字を示している。
こちらは2026年9月、同じ台本と標準設定を使い、Eleven v4 TurboをWebSocketでストリーミングして測定したものだ。各システムのネットワーク遅延は測定値から除外されている。
約100msと約150msでは測っている対象が異なるため、単純に比較することはできない。差の約50msを特定の処理にかかった時間だと考えることもできない。
会話全体の待ち時間を短くする仕組みとして、LLMが回答を最後まで書き終える前から、生成されたテキストを順次音声モデルへ送り、音声を返していく双方向ストリーミングにも対応する。
文章全体の生成を待ってから読み上げを始める方式と比べ、テキスト生成と音声生成を並行して進められる点が重要になる。
電話応対などで利用する場合は、音声モデル単体の速さだけではなく、LLMによる回答生成や通信も含めた状態で、実際の会話に不自然な間が生じないかを確認する必要がある。
v4とTurboを選ぶ際には、速度だけでなく音質も考慮する必要がある。日本法人によれば、Turboはv4と同等の表現機能を備える一方、音質との間にはわずかなトレードオフがある。
作品として仕上げるナレーションなどではv4、応答速度が重要な対話用途ではTurboという使い分けが基本になる。Turboの方が速いからといって、あらゆる用途で上位というわけではない。
API料金は10月12日までの割引と通常価格を分けて考える
9月29日時点のElevenAPI料金表では、両モデルに10月12日までの割引が設定されている。
APIの1,000文字あたりの料金は、割引期間中がv4で0.022ドル、Turboで0.011ドル。通常価格はそれぞれ0.08ドルと0.04ドルとなる。
| モデル | 割引中の1,000文字単価 | 割引中の100万文字換算 | 通常の1,000文字単価 | 通常の100万文字換算 |
|---|---|---|---|---|
| Eleven v4 | 0.022ドル | 22ドル | 0.08ドル | 80ドル |
| Eleven v4 Turbo | 0.011ドル | 11ドル | 0.04ドル | 40ドル |
100万文字あたりの金額は、公式に示されている1,000文字単価を1,000倍したものだ。月額プランの料金や、実際の利用時に請求される総額とは異なる。
割引期間中の費用と通常価格を分けて考えておけば、一時的な安さを前提に長期の制作予算を組んでしまうことを避けられる。
品質については外部評価もある。9月29日に確認したArtificial AnalysisのProvider Voice Arenaでは、Eleven v4が首位となっている。
ただし、これは利用者による音声の好みを基にしたランキングであり、日本語のあらゆる台本や、自分で作成したクローン音声でも同じ結果になることを保証するものではない。
ElevenLabsが公表した「約75%の比較で好まれた」という結果も、文字を正しく読み上げられた割合を測ったものではない。同じ文章を生成した音声を聞き比べ、表現力と自然さのどちらを好むかを評価したブラインドテストだ。
比較対象はCartesia Sonic 3.6、Inworld TTS-2、GoogleのGemini 3.8 Flash TTSとFlash-Lite TTSで、同点は0.5票として集計している。
ランキングや選好率は試してみる理由にはなるが、自分の作品に適しているかどうかは、実際に使っている声と台本で比較する必要がある。
移行を評価するなら、短い紹介文だけでなく、実際の作品から差し替えたい一文とその前後、さらに同じ登場人物に別の言語を話させた音声などを比べるとよい。
会話用途であれば、LLMによる回答生成を含め、利用者が話し終えてから音声が返り始めるまでの時間も測る必要がある。
こうした条件でも声の個性や演出意図を維持できることが確認できれば、v4の表現力向上を、作品の修正や多言語展開にかかる手間の削減へつなげられる。



