Googleは2026年9月24日、音声対話モデル「Gemini 3.8 Live」に、AIの発話に合わせて表情や口元が動く「Live Avatar」を追加し、企業向けのGemini Enterpriseで一般提供を開始した。

利用者の声やカメラ映像を受け取り、AIが話す音声に合わせてアバターの口元や表情を動かす。Googleが想定するのは、接客や案内、保険請求の受付といった用途だ。

音声だけでなく画面上に「顔」が現れれば、利用者は会話の相手をより強く意識するようになるかもしれない。

ただし、滑らかに動くアバターを見て、AIも同じ速度で周囲の状況を理解している、あるいは長時間の複雑な手続きを任せられると考えてよいわけではない。公開された仕様やモデルカードを見ると、その能力には明確な限界がある。

AD

音声対話AIに「顔」を加えた

9月15日に発表されたGemini 3.8 Liveは、利用者の声を聞いて音声で応答し、会話を続けながら外部ツールも呼び出せるモデルだ。

今回のLive Avatarは、その音声に同期して動くアバター映像を生成する機能を加えたものとなる。

Googleは発表文で、発話に合わせて口元や表情を動かし、会話の途中で言語が切り替わっても97言語に対応すると説明している。

97言語への対応自体は、基盤となるGemini 3.8 Liveですでに掲げられていた。Live Avatarで新たに加わったのは、言語が切り替わる会話でも、音声に合わせた顔の動きを映像として生成する機能だ。

Google Cloudは、Webサイト、スマートフォン、店頭や施設の案内端末などで利用する企業向けAIエージェントを想定している。

例えばホテルのチェックインでは、予約情報を検索している間も利用者との会話を続ける。保険の受付では、利用者がカメラで見せた損傷を確認しながら、別の業務システムへ処理を依頼するといった使い方が示されている。

外部システムから結果が返ってくるまで会話を止めずに済む「非同期」のツール呼び出しと、アバターによる対話を組み合わせる仕組みだ。

ただし、これらはGoogleが示した利用例やデモであり、実際の業務環境における処理成功率や応答時間を測定した結果ではない。

Google Cloudの発表では、Gemini Enterpriseでの一般提供と、米国・EUのエンドポイントが案内されている。

一方、より長く推論する「Gemini 3.8 Live Extended Thinking」は、同時点では非公開プレビューだ。

Gemini 3.8 Live本体、Live Avatar、Extended Thinkingでは、それぞれ提供状況が異なる。これらをまとめて「Gemini 3.8 Liveで利用できる機能」と捉えると、現時点で実際に使える範囲を見誤る。

また、日本国内でのデータ処理や、日本向けサービスで利用する場合の条件についても、今回の発表だけでは判断できない。

「毎秒24フレーム」でも、AIが映像を24回見ているわけではない

Googleの公開仕様によると、Gemini 2.5 Flash LiveとGemini 3.8 Liveは、どちらも利用者側から入力される映像を毎秒1フレームで処理する。

一方、Gemini 3.8 Liveが生成するアバター映像は毎秒24フレームだ。

項目 Gemini 2.5 Flash Live Gemini 3.8 Live
利用者から入力される映像 毎秒1フレームのJPEG 毎秒1フレームのJPEG
AIが生成するアバター映像 非対応 毎秒24フレームのMP4
音声出力 24kHz PCM 24kHz PCM

この表はGoogle Cloud開発者ガイドの比較表から、映像の入出力と音声出力に関する項目を抜き出したものだ。

重要なのは、利用者のカメラ映像をAIが受け取る処理と、AIがアバター映像を生成して返す処理は別だという点である。

アバター映像が毎秒24フレームだからといって、AIが利用者のカメラ映像を毎秒24回確認して状況を判断しているわけではない。

逆に、入力映像が毎秒1フレームだからといって、生成されるアバターの動きが毎秒1フレームになるわけでもない。

一方はAIが周囲を見るための映像入力、もう一方は利用者に見せるアバター映像の滑らかさを示しており、数字の意味が異なる。

Live Avatarを利用する際、開発者はAPIの応答形式として映像を指定し、用意されたアバターと声を選択する。

Googleの設定ガイドでは、WebSocketで接続する方法に加え、参照画像から独自のアバターを作成する方法も案内している。

つまりLive Avatarは、別の動画再生ソフトを後から組み合わせる仕組みではなく、Live APIの応答として音声と映像を生成する機能として設計されている。

ただし、公開仕様から分かるのはあくまで入出力形式だ。97言語それぞれで口の動きがどの程度正確に音声と一致するのか、ネットワーク通信まで含めた実際の遅延がどの程度になるのかを示す性能評価ではない。

AD

数分の対話と、長時間の手続きは別

Google DeepMindのGemini 3.8 Audioモデルカードでは、アバターを使った連続対話について、数分程度の会話には対応できるものの、何時間にもわたる連続利用を想定したものではないと説明している。

出力上限も異なり、通常のLiveでは64Kトークン、アバター利用時は24Kトークンとされている。

これは、受付などの一連の会話を必ず数分以内に終わらせなければならないという意味ではない。

ただし、長時間にわたる相談や手続きを、最初から最後まで一つの途切れないセッションとして処理できることを前提にはできない。

モデルカードでは、幻覚に加え、遅延やタイムアウトも既知の制約として挙げられている。

Googleが強調する非同期のツール呼び出しは、予約検索など外部システムから結果が返ってくるまでの間も、AIが利用者との会話を続けられる仕組みだ。

開発者ガイドには、結果を待つ必要がある処理を別に管理し、利用者が途中で新しい指示を出した場合に、未完了の処理を取り消す仕組みも示されている。

例えば利用者がホテルの予約変更を依頼し、その結果が返る前に別の指示を出した場合、「会話が続いていること」と「予約変更が確定したこと」を分けて管理する必要がある。

途中で取り消された処理を、AIが完了したものとして利用者へ伝えてしまえば、アバターが自然に話し続けていても、実際の予約記録と利用者の認識が食い違う。

つまり、AIが会話を流暢に続けられることと、外部システム上の処理が正しく完了していることは別の問題だ。

宿泊予約や保険請求のように処理結果が記録として残る業務では、対話が途中で切れた場合に、どこまで処理が完了しているのかを確認する仕組みや、人間の担当者へ引き継ぐ導線を企業側が設計する必要がある。

これは公開仕様から考えられる運用上の課題であり、Googleがこうした業務での成功率を公表したという意味ではない。

顔のあるAIとの会話によって、利用者が手続きを続けやすくなる可能性はある。

しかし、その実用性を判断するには、アバター映像の滑らかさだけでなく、通信や対話が途切れた場合の復帰、誤った回答をした後の訂正、人間の担当者への引き継ぎなども確認する必要がある。

現時点で公開された資料には、こうした一連の運用を実環境で評価した結果は見当たらない。

本物らしい「顔」を使うほど、企業側の責任も増える

Live Avatarでは、Googleが用意したアバターだけでなく、参照画像を使って独自の顔を作ることもできる。

ただし、この機能を利用できるのは選定された顧客に限られる。

Googleの設定ガイドでは、顔や声の素材を利用するために必要な同意や権利を確保する責任は、サービスを導入する企業側にあると明記している。また、未成年者や著名人の画像を使用しないよう求めている。

1枚の参照画像から、その人物に似た顔を動かせる仕組みは、企業が独自のキャラクターやブランドイメージを作る際には便利だ。

しかし、他人の顔を使用する権利があるかどうかを、APIが企業に代わって確認してくれるわけではない。

Googleはまた、生成される音声と映像の双方に、目には見えない電子透かし「SynthID」を埋め込むと説明している。

これはAIによる生成物を識別するための対策だ。

ただし、SynthIDが埋め込まれていることと、画面を見ている利用者がその場で「これはAIだ」と認識できることは別である。

今回確認できる発表やモデルカードには、再録画や加工を経た映像について、どのような条件までSynthIDを検出できるかを示す実測結果も掲載されていない。

そのため、電子透かしだけを、利用者へのAI利用の表示や本人確認の代わりにすることはできない。

The Registerの報道は、Googleの研究者らが以前から、人間らしいAIに対して利用者が実際以上の能力や共感性を期待する危険について論じてきたことを指摘している。

Live Avatarによって顔と声が加われば、企業の窓口として親しみやすく感じられる可能性はある。

しかし、アバターが自然な表情で話すことは、回答が正確であることや、AIが利用者の状況を十分に理解していることの証明にはならない。モデルカードにも、幻覚を含む生成AI特有の限界は残されている。

企業がこの技術を顧客対応に導入するのであれば、相手が生成AIであることを分かる形で示し、誤りがあった場合に訂正できること、必要に応じて人間の担当者へ引き継げることまで含めて設計する必要がある。

アバターの見た目や動きの自然さだけでなく、その背後にあるAIと業務システムがどこまで確実に動くのか。それが、Live Avatarを実際の接客や窓口業務で評価するうえで重要になる。

 

  1. 顔を持つGemini 3.8 Liveが企業向けに登場 映像の滑らかさと対話時間の限界
  2. AI受付はどこまで任せられるか Googleの新アバターを公開仕様で読む
  3. GoogleのAIアバターは毎秒24コマで話す カメラ入力と映像出力の違い