コペンハーゲン大学は9月26日、AIチャットボットの回答は、通常のWeb検索で得られる情報に比べて、含まれる知識の範囲が狭く、特定の内容に偏りやすいとする研究を紹介した。
27の大規模言語モデルを比較したところ、新しいモデルほど回答に含まれる情報の多様性はおおむね改善していたものの、研究で比較対象としたWeb検索結果の水準には、いずれのモデルも届かなかった。
ただし、これはAIの正答率を測った研究でも、AIの普及によって人間社会からどれだけ知識が失われたかを示した研究でもない。測定したのは、同じテーマについてさまざまな聞き方をしたとき、回答にどれだけ多様な内容が現れるかという「知識の幅」である。
研究を率いたのは、現在デンマークのオールボー大学に所属するDustin Wright氏らのチームだ。論文は自然言語処理の国際会議EMNLP 2026に採択されている。arXivで公開された最新版を読むと、大学発表で使われた「18.7%」という数字についても、解釈に注意が必要なことが分かる。
約170万件の回答を7000万件の「主張」に分解
研究チームは155のテーマについて、それぞれ200通りの質問文を用意し、約170万件の回答を生成した。そこから約7000万件の「主張」を抽出して分析した。
対象にはOpenAIのGPTシリーズのほか、Llama、Gemma、Qwenの各シリーズが含まれる。12か国に関係する人物、歴史上の出来事、一般的な概念などを対象とし、テーマが変わっても同じ種類の質問を試せるように設計した。
ここでいう「主張」とは、回答に含まれる個々の説明内容を指す。
表現が異なっていても意味が同じなら、同じ内容としてまとめる。毎回ほぼ同じ説明を返すモデルと、さまざまな内容に触れるモデルを区別するためだ。
そのため、回答が単に長くなったり、表現が豊かになったりしただけでは、知識の多様性が高まったとは評価されない。
評価には、生態学などでも使われる「Hill-Shannon多様度」という指標を用いた。含まれる情報の種類だけでなく、それぞれがどの程度の頻度で現れるかも考慮する。
例えば4種類の内容が均等に現れれば多様性は高くなる。一方、同じ4種類が含まれていても、そのうち1種類ばかりが繰り返し現れれば値は低くなる。
つまり、珍しい内容が一度だけ登場するケースと、幅広い内容が繰り返し回答に現れるケースを区別できる。
比較対象としたのは、Google検索の結果から収集したWebページ群だ。
研究チームは2026年1月1日、米国向けのGoogle検索で各テーマ名を検索し、上位最大40ページを取得した。
Google検索のAI要約機能とチャットボットを比較した研究ではなく、検索を利用した人間が実際にどれだけ多くの知識を得たかを測った研究でもない。
さらに研究チームは、取得した文章量の違いだけで結果が決まらないよう、情報の分布をどの程度捉えられているかを推定し、必要に応じてサンプル数を調整して比較した。
それでも、対象は研究チームが選んだテーマについて英語で質問した場合の結果だ。
比較されたモデルも2022年末から2025年に登場したものが中心で、2026年現在提供されているすべてのAIサービスを網羅したランキングとして読むことはできない。
「18.7%」は何と何を比べた数字なのか
論文の第6.2節では、155テーマを平均した多様度が、Google検索では3110、対象モデルの中で最も高かったGPT-5では2621だった。
著者らはこの結果から、検索結果はGPT-5よりも少なくとも18.7%多様だったとしている。
一方、コペンハーゲン大学の発表では、GPT-5の情報の多様性がGoogle検索より18.7%低いという方向で説明されている。
しかし、割合はどちらを基準にするかによって変わる。
| 比較方法 | 論文の平均値を使った計算 | 割合 |
|---|---|---|
| GPT-5を基準に、検索結果がどれだけ上回るか | (3110 − 2621) ÷ 2621 × 100 | 約18.7% |
| 検索結果を基準に、GPT-5がどれだけ下回るか | (3110 − 2621) ÷ 3110 × 100 | 約15.7% |
同じ3110と2621という数字でも、GPT-5を基準にすれば「検索結果の方が約18.7%高い」となり、検索結果を基準にすれば「GPT-5の方が約15.7%低い」となる。
この表は、2026年8月31日版の論文に記載された155テーマの平均値を使い、小数第1位まで計算したものだ。
そのため、論文そのものに沿った表現は、**「Google検索の方がGPT-5より少なくとも18.7%多様だった」**となる。
「少なくとも」とされているのは、比較方法にも理由がある。
検索で集めたWebページでは、存在する情報の分布を十分に捉え切れていないテーマもあった。研究チームは、一定の基準を満たす場合にのみ検索側のサンプルを減らして条件をそろえている。
このため著者らは、測定された検索結果の優位性を下限と位置づけている。
一方、約15.7%という数字も、公表されている平均値から逆方向に計算すれば得られる。ただしこれは、AIがWeb上に存在する知識の15.7%を必ず失っているという意味ではない。
情報の多様性が低いことと、回答が間違っていることは別の問題だ。
同じ内容に回答が集中していたとしても、その内容自体が正しい可能性はある。この研究だけから、AIの正答率や誤情報の割合を判断することはできない。
Web検索を組み合わせると多様性は高まるが、それでも検索結果には届かない
研究では、モデルが内部に持つ知識だけで回答する場合に比べ、外部資料を参照する検索拡張生成(RAG)を使った場合には、回答の多様性が有意に高まった。
RAGでは、Google検索上位20ページを情報源とし、質問に関連する部分を最大1000トークンまでモデルへ与えている。
外部の情報を追加することで、回答に現れる内容の幅が広がったことになる。
ただし、RAGを使ったモデルでも、Web検索結果そのものの多様性には届かなかった。
モデルの規模についても、今回調べた範囲では、大きなモデルほど情報の多様性が低くなる傾向が確認された。
著者らは、大規模モデルほど学習データの中で頻出する情報を強く記憶・再現する可能性を理由の一つとして挙げている。
ただし、これは研究結果から考えられる仮説であり、その仕組みを実験で証明したわけではない。また、正答率や推論能力などを含むモデル全体の性能で、小型モデルの方が優れているという意味でもない。
RAGによる改善の大きさには、対象となる国による違いも見られた。
国別に平均すると、検索結果そのものに含まれる情報が多様な国ほど、RAGによって回答の多様性が大きく改善する傾向があった。
著者らは、米国向けに設定したGoogle検索を使用したことが、地域ごとの差に影響している可能性も指摘している。
つまり、AIモデルそのものだけでなく、どの情報源を検索し、モデルに渡しているかによっても、回答に含まれる知識の範囲は変わる。
英語圏の情報が回答に反映されやすい傾向も
地域による偏りは、英語版Wikipediaと各国の現地語版Wikipediaに記載された内容を照合した分析でも確認された。
分析対象となった8か国のうち5か国では、英語版Wikipediaに含まれる情報の方が、モデルの回答に有意に反映されやすかった。
一方、現地語版の情報が英語版より有意に強く反映された国はなかったという。
ただし、これはモデルへの質問を英語で行った場合の結果である。日本語でAIチャットボットを利用した場合に同じ傾向になると直接示した研究ではない。
ある地域について流暢に説明できることと、その地域で蓄積されてきた知識を幅広く取り上げられることは、必ずしも同じではない。
RAGを導入しても、参照するWebページが同じ言語圏や似た情報源に偏っていれば、回答の多様性には限界が残る。
単にWeb検索機能を搭載しているかどうかだけでなく、どの言語や地域の情報源を検索しているのかも、AIの回答を評価するうえで重要になる。
「知識崩壊」はすでに起きているのか
新しいモデルほど情報の多様性が改善する傾向が確認されたことも、この研究の重要な結果だ。
Qwenを除く各モデル系列では、新しい世代になるほど多様性の指標が高くなる傾向が見られた。
大学の発表では、論文の共著者であるコペンハーゲン大学のIsabelle Augenstein教授も、こうした改善を説明したうえで次のように述べている。
「知識崩壊はまだ起きていない」
研究チームが警戒しているのは、AIを通じて情報を得る機会が増えることで、AIが頻繁に選ぶ一部の説明ばかりが社会で繰り返されるようになる将来のリスクだ。
さらに、AIが生成した均質な文章がWeb上に増え、それが次世代AIの学習データやRAGの検索先として再利用されるようになれば、外部情報を参照することで回答の幅を広げる効果まで弱まる可能性がある。
ただし、そのような循環によって社会全体の知識がすでに失われ始めていると、この研究が実証したわけではない。
研究対象の選び方にも限界がある。
研究チームは、Wikipediaに十分な記述が存在するテーマを中心に選んでおり、極めて珍しい事柄や、小規模な地域・共同体だけで共有されている知識まで網羅しているわけではない。
また、AIの回答を個々の「主張」に分解し、意味が同じものをまとめる処理にも誤差が生じる可能性がある。
国単位の比較だけでは捉えられない地域差もあり、多様性という一つの指標だけでAI回答の価値を判断することはできない。
利用者にとって、この研究は「同じAIに別の言い方で聞き直せば十分なのか、それとも別の情報源を自分で調べる必要があるのか」を考える手がかりになる。
開発者側には、正確性や関連性だけでなく、どの情報が繰り返し選ばれているのか、どの言語や地域の情報が回答から抜け落ちているのかを検証する余地がある。
Web検索を組み合わせるだけでは十分ではない。多様な情報源を集め、その内容が実際の回答にも反映されていることを確認できて初めて、検索機能を備えたAIは、利用者が触れられる知識の範囲を広げられる。



