NVIDIAは2026年9月23日、会話の中で「誰が、いつ話したか」を時刻付きで分けるAIモデル「Nemotron 3 Diarization」を公開した。従来のStreaming Sortformerが扱える話者は最大4人だったが、新モデルは最大8人に対応し、録音した音声にもライブ音声にも使える。会議録で発言者を追いやすくなる半面、「8人対応」は8人の発言を常に正確に区別できるという意味ではない。独立した評価の内訳を見ると、人数によって得意不得意が分かれる。

AD

公開で何が変わったか

NVIDIAが公開したのは、約1億パラメータの学習済みモデルの重みだ。音声を入力すると、時刻ごとに最大8つの話者チャンネルについて「発話している可能性」を返す。各チャンネルには、会話に最初に現れた順にラベルが付く。「話者0」「話者1」のような匿名の区分であり、人の名前を声から割り出す本人確認ではない。複数の人が重なって話す場面では、同じ時刻に複数のチャンネルが活動できる。

旧モデルも、音声を小分けにして処理し、前の区間で見つけた話者の情報を次へ引き継ぐ仕組みを持っていた。新モデルはその到着順の話者キャッシュと直近音声の記憶を受け継ぎながら、出力できる話者を4人から8人へ増やした。したがって、今回の変化を「初めてリアルタイムで話者を分けられるようになった」と捉えると、旧モデルができていたことを見落とす。大人数の会話を一つのモデルで扱える範囲が広がった点が新しい。

モデルは発話の内容を文字にはしない。NVIDIAのモデルカードには、話者ごとの開始時刻と終了時刻を得る手順と、別の音声認識モデルを組み合わせる例がある。会議録を作るなら、言葉を認識する処理と話者を分ける処理を時刻で突き合わせる必要がある。名前まで表示したければ、匿名ラベルを実際の参加者に結び付ける別の情報も要る。

8人対応の評価で見える強みと弱み

独立評価を行うVoice Arenaの初期結果では、Nemotron 3 Diarizationは12システム中で首位となり、総合の話者分離誤り率は14.72%だった。次点のDiariZen WavLM Large s80 MD v2は19.34%である。話者分離誤り率は、発話を見逃した時間、無音を発話と誤った時間、別の話者に割り当てた時間を合わせて測る。低いほどよい。ただし総合順位だけでは、「8人まで使える」の中身は分からない。

Voice Arenaの同じ評価では、2人の会話でNemotron 3の話者分離誤り率が次点モデルより3.02ポイント高かった。5〜8人の会話では、Nemotron 3の話者分離誤り率が次点モデルより11.57ポイント低かった。

会話の人数 会話数 Nemotron 3 次点モデル 読み方
2人 37件 10.31% 7.29% 次点モデルの誤り率が低い
5〜8人 17件 22.18% 33.75% Nemotron 3の誤り率が低い

数値はVoice Arenaの人数別比較から、2人の群では10.31から7.29を引き、5〜8人の群では33.75から22.18を引いて求めた。同評価は139件、約22時間の英語会話を対象に、録音後の最終的な話者の時刻情報を人手で確認した正解と照合した。重なった発話を採点し、発話の境界には許容幅を設けない。参加者数もシステムへ事前に教えない。表の5〜8人は17件を合わせた値で、8人だけの精度を示すものではない。

この内訳は、比較相手を選ぶときに人数と録音環境を確認する必要を示す。2人の会話なら総合首位という肩書だけで選べない。この評価の5〜8人群では新モデルが優位だったが、誤り率は22.18%残る。評価音声の内訳では、6〜8人の会話は通話に限られる。対面の大人数会議でも同じ差が出るとは言えない。担当者を誤って付ければ、議事録の「誰が約束したか」まで変わり得るため、重要な発言は元音声と照合できる設計が欠かせない。

「8人」という上限は、出力に8つの話者枠が用意されていることを意味する。8人が同時に話す場面や、声質の近い参加者がいる会議の正答率を保証する数字ではない。Voice Arenaの人数別集計は、まさに仕様値と用途別の実測値を分けて読む必要を示している。

NVIDIA自身の同条件比較も改善を示す。多言語のDIHARD III評価全体では、入力待ち時間を1.04秒に設定したとき、旧4話者モデルの誤り率19.60%に対して新モデルは13.18%だった。ただし、これはVoice Arenaの英語139会話とは別の音声と採点条件による値だ。しかもDIHARD IIIの「5〜9人」群には、新モデルの仕様上限を超える9人の音声も含まれる。異なる評価のパーセンテージを横に並べ、単一の性能差として扱うことはできない。

別の電話会話の評価でも、人数を一括りにはできない。NVIDIAが公開したCALLHOME-Part2の30.4秒設定では、2人の会話に限ると旧モデルの誤り率が5.68%、新モデルが5.98%で、旧モデルの方が低い。一方、同データ全体では旧10.32%に対して新9.10%だった。人数が増えた場合の改善を、少人数の会話へ機械的に当てはめてはいけない。

AD

「リアルタイム」の秒数は何を測ったか

モデルカードには、入力待ち時間として30.4秒、1.04秒、0.64秒、0.32秒の設定が並ぶ。短い設定ほど音声が届いてから話者ラベルを出すまでの待機を減らせるが、この秒数はモデルが音声の塊と少し先の音声を受け取るまでの時間だ。計算そのもの、音声認識、通信、画面表示にかかる時間は入っていない。「0.32秒で会議録が完成する」という読み方はできない。

待つ音声の長さを変えると、認識に使える前後関係も変わる。NVIDIAのDIHARD III全体の評価では、新モデルの話者分離誤り率は30.4秒設定で12.73%、1.04秒設定で13.18%だった。差はこの評価条件での値であり、どの会議でも同じ幅で悪化するという予測ではない。端末でライブ字幕を出す用途なら、入力待ち時間を短くしても話者の取り違えが許せるかを調べる。録音後の議事録なら、より長く待つ設定も選択肢になる。

モデルカードは、82,611時間の合成した複数人の音声と約1万時間の実際の会話を学習に使ったと記す。ただし、公開された評価表を日本語の会議の精度へそのまま広げる根拠はない。話者の人数だけでなく、同時発話、部屋の響き、マイクの位置によって音声は変わる。導入時には実際に使う録音で、話者ごとの誤りと処理全体の時間を確かめたい。

会議録に組み込む前の確認点

NVIDIAはモデルの重みを公開し、商用・非商用で使えると説明している。適用されるOpenMDW 1.1ライセンスは無償での利用を認める一方、モデルの素材を再配布する際にはライセンス文と適用される権利表示を残すよう求める。「無料公開」は、音声認識や運用まで無料で完成するという意味ではない。

実際の製品では、話者分離と文字起こしの結果を同期させる処理が必要だ。NVIDIAの公式解説も、話者の時刻情報を音声認識へ組み合わせる流れを示す。声が重なれば、単語をどの話者へ割り当てるかも難しくなる。匿名ラベルが会話の途中で安定していても、それだけで参加者の実名を保証できるわけではない。

まず確かめるべきなのは、自分たちの音声に何人が現れ、どれほど発話が重なるかだ。その上で日本語の会議や使うマイクで話者を取り違える頻度を測り、文字起こしを含む全工程の遅延を計る。最大8人という仕様は候補を広げるが、採用を決めるのはその実測値になる。