米Tavusは2026年10月1日、音声と映像を使って対面のような会話を続けるAI「Griffin」を発表した。同社の実験では、研究プレビュー版のGriffin-Liteと1分間話した54人のうち26人が、相手を実在の人間だと判断した。Griffinは、話している最中も相手を見聞きし、相づちや表情を会話の途中で返す設計を採用している。人間らしい顔や声だけでなく、会話の「間」まで扱えるようにした形だ。ただし、人間だと思われた割合と、自然に応答する能力、反応の速さは、それぞれ別の指標として確かめる必要がある。

AD

1分間の自社実験で何が起きたのか

54人中26人という結果には、通話前に参加者へどのような説明をしたかが関係している。Tavusは外部の研究プラットフォームで参加者を募り、「別の参加者」と今年楽しみにしていることについて1分間話す、と説明した。実際の相手は、顔と声をその場で生成するGriffin-Liteだった。AIか人間かを見分けるよう、あらかじめ課題を与えた試験ではない。

通話後には、相手が話した内容を書いてもらい、自然さや会話の流れも評価してもらった。アンケートの末尾で、相手が人間ではないかもしれないと思ったかを尋ね、最後に全員へAIだったことを知らせている。以前のPhoenix-4.5、Sparrow-2、Raven-1を組み合わせたシステムでは、同じ手順で41人中1人、約2.4%が人間だと判断した。今回は約48%だった。少なくとも、同社の従来システムと比べると、人間だという印象を保ったまま会話できるケースが大きく増えたことになる。

Tavusはこれを「初めてビデオチューリングテストに合格したモデル」と表現している。しかし、公表された実験方法と結果には、同じ条件で本物の人間と通話した対照群の成績や、参加者を無作為に割り付けたかどうかが示されていない。外部のプラットフォームで参加者を募集したことも、第三者が独立して実験を実施したことを意味しない。48%という数字を、そのまま「人間とAIの判別がコイントス並みに難しくなった」という結論へ置き換えることはできない。

試験時間は1分間で、話題も限られている。長時間の会話や、最初から相手がAIだと知らされている状況でも同じ結果になるかは、この実験だけでは分からない。一方でTavusによると、AIではないかと疑った人は、最初の20秒以内にそう感じる傾向があった。短い通話でも違和感を覚えた人はいたのであり、誰に対しても人間だと思わせられる段階に達したわけではない。

相づちと表情を、話している途中に返す

話し手が言葉を止めて目をそらしたとき、その沈黙は「話し終えた」合図にも、「続きを考えている」合図にもなり得る。NVIDIAとDavid AIが開発した評価手法VideoFDBは、この違いを対話AIの課題として挙げている。音声の切れ目だけを見れば返事を始めてもよさそうでも、視線まで考慮すれば待つべき場面がある。画面に何が映っているかを説明できることと、その映像を手掛かりに会話の間を判断できることは、別の能力だ。

Tavusが従来型として説明するのは、音声を文字に変換し、言語モデルが返答を作り、その内容を声と顔の映像へ変換する処理を順番につなぐ方式である。この構成では、後段の映像生成が発話音声に従って動くため、相手が話している最中のうなずきや、声を出さずに表情だけを変える反応を組み込みにくい。VideoFDBの研究でも、評価対象となった音声駆動型のアバターでは、こうした非言語的な反応が不足していたと報告されている。

Griffinは、会話の判断と音声・映像の生成を並行して進める。判断を担う部分が音声と映像を受け取り、1秒未満の間隔で、話すか待つかを繰り返し判断する。そこから送られる制御信号には、発話内容に加えて声の調子や身振りの指示も含まれる。生成側はその指示に従って声と映像を少しずつ作り、再生中も相手を見聞きし続ける。話しながら同時に聞く「全二重」の対話である。

ただし、「統合」という説明は、すべてを一つのニューラルネットワークで処理するという意味ではない。Tavus自身の技術解説では、会話を判断する部分と、音声・映像を生成する部分に分かれた構成が示されている。設計上の大きな変化は、各部分が相手の発話終了を待って順番に動くのではなく、発話途中の反応も含めて継続的に動き続ける点にある。

映像側は、1枚の参照画像から顔だけでなく身体や背景まで生成すると同社は説明している。720pの映像を毎秒25フレームで出力し、一度に生成するのは320ミリ秒分、つまり8フレームの映像だ。音声側も文全体が完成するのを待たずに出力し、最小10ミリ秒単位で再生できる。この細かな単位で生成することで、途中で届いた声の調子や動作の指示を、その後の出力へ反映できる仕組みになっている。

ここでいう320ミリ秒は、一度に生成する映像の長さであり、人の発言に対する応答時間ではない。Tavusが別に公表した0.43秒という値は、H100上で映像生成器に音声を入力してから、その音声の影響が映像に現れるまでの平均遅延である。会話内容を判断する処理まで含めた応答速度については、別の評価を見る必要がある。

AD

人間に近い点数と、残るタイミングの差

NVIDIAの公開表では、Griffin-LiteはVideoFDBの生成部門で3.83点を得た。人間の参照値は3.92点、次点のGemini 2.5とAnamを組み合わせた構成は2.80点だった。これは、相手を人間だと思った人の割合ではなく、AIが返した音声と映像を評価基準に沿って採点した値である。VideoFDBは実際のビデオ通話から集めた237本のクリップを使い、言語モデルによって0〜5点で採点する。

相手の振る舞いを読み取り、適切な返答につなげる知覚部門でも、Griffin-Liteは3.73点で公開表の首位に立っている。人間の参照値は4.20点だった。比較対象の中で最も高かった3.44点は、MiniCPM-o 4.5に映像を与えない構成の値である。生成部門と知覚部門では評価している能力も比較対象も異なるため、単純に一つの総合順位へまとめることはできない。

生成部門の3.83点を項目ごとに見ると、人間に近づいた部分と、まだ差が残る部分が分かる。

VideoFDB生成部門の指標 Griffin-Lite 人間の参照値
流暢さ 4.25 4.42
相手との感情表現の一致 4.40 4.14
非言語動作の適切さ 2.83 3.18
総合スコア 3.83 3.92
発話タイミングの適合率 62.8% 78%
遅延中央値 1,892ミリ秒 900ミリ秒

出典は2026年10月2日に確認したNVIDIAの生成部門の表。スコアは0〜5点で、タイミングの適合率と遅延は別の指標である。

Griffin-Liteの感情表現は、人間の参照値を上回っている。一方、表情や身振りがその場面に合っているかを測る非言語動作の評価は、人間より低い。声や表情で感情を表すことが得意でも、それを適切なタイミングで出せるとは限らない。総合点が人間に近いというだけで、あらゆる反応が人間並みになったと捉えると、この違いを見落とす。

NVIDIAのVideoFDB生成部門では、Griffin-Liteの遅延中央値は1,892ミリ秒で、人間の参照値900ミリ秒の約2.10倍だった。1,892÷900で算出した値であり、同じ部門の同じ指標を比較している。ただし、論文の付録C.2で定義される遅延は、会話中に注釈を付けた出来事を基準としている。発話を始める場面や、割り込みを受けて相手へ発話権を譲る場面などを測るもので、質問を受けてから返答するまでの時間や、映像生成器単体の平均0.43秒とは区別する必要がある。

発話タイミングの適合率も、人間の78%に対してGriffin-Liteは62.8%だった。すぐに話し始めることが適切な場面もあれば、黙って待つほうが自然な場面もある。Griffinの進歩は従来の処理を順番につないだアバターとの差に表れているが、適切な「間」を選ぶという課題は残っている。

VideoFDBを提案したAmrita Mazumdar氏らの論文は、2026年5月公開のプレプリントである。付録Bでは、対象が米国・カナダの英語による2人のビデオ通話であり、評価も会話中の単一ターンを対象としていることが明記されている。今回の最新順位はNVIDIAの公開表で確認できるものの、日本語での会話や、長期間にわたる関係構築まで実証した結果ではない。

人間だと思わせることと、話しやすいこと

Tavusの通話実験では、相手をAIだと推測した参加者も、「また話したい」という項目に7段階中5.4を付けた。全体の平均は5.8だった。相手をAIだと疑った参加者にも、再び対話したいという意向があったことを示している。ただし、最初からAIだと知らせた場合との比較実験ではないため、AIであることを開示した場合の受け入れられやすさを示す数字ではない。

同社が想定する用途には、理解できていない様子を表情から読み取り、説明の仕方を変える学習支援や、難しい会話の練習などがある。壊れた部品をカメラへ見せながら相談するサポート用途も想定している。いずれも、顔が本物らしく見えること以上に、相手がどこまで理解しているのか、いつ返事を必要としているのかを読み取れることが役立つ場面だ。ただし、現時点でこうした用途の効果が実証されたわけではなく、Tavusが示している将来的な利用例にとどまる。

提供も慎重に進められている。Griffin-Liteは一部のテスター向けの研究プレビューに限られており、一般の顧客はまだ利用できない。Tavusは、相手にAIであることを知らせる機能などの安全対策を開発中で、そうした課題に対応してから、より高性能なバージョンを公開する方針を示している。具体的な一般提供日や価格は明らかにしていない。

既存のTavusの利用方針では、顔や声を複製される本人の明示的な同意を求めるとともに、会話の相手にもAIであることを明確に知らせるよう利用者に義務付けている。本人が顔や声の複製を認めることと、会話相手が誰と話しているのかを知ることは、別々に満たす必要がある条件だ。ただし、規約で開示を求めていることと、Griffinを使ったすべての通話で自動的にAIであることを知らせる仕組みが実装されていることは同じではない。

Griffinが示しているのは、対話AIを評価するうえで、返答の文章に顔を付けるだけでは捉えられなかった、動作や会話の「間」まで見る必要が出てきたという変化だ。利用者が相手をAIだと理解したうえでも、考え込む時間を尊重し、戸惑いに応じて説明を変えられるのであれば、人間側が機械に合わせて話し方を変える負担を減らせる。その条件で学習や会話の練習を本当に支援できるかどうかが、人間らしい映像を実用的な対話へつなげる判断材料になる。