米国のForecasting Research Institute(FRI)は9月22日、AIの専門家や、予測で高い実績を持つ「超予測者」が、AIの進歩をどれほど正確に見通してきたかについて、暫定的な検証結果を公表した。
数学やコード生成のベンチマークでは、2022年に集められた予測だけでなく、ChatGPT登場後に行われた比較的新しい予測も、実際の進歩に追い越されている。
一方、雇用や経済など社会への影響を問う設問の多くは、まだ結果が確定していない。
AIの能力向上を実際より遅く見積もっていたことは確認できる。だが、その外れ方をそのまま将来の雇用や経済への影響にも当てはめてよいのかは別の問題だ。
FRIが示した数字は、すでに結果が確定したもの、期限前の途中経過、将来の推計を分けて見る必要がある。
FRIは、2022年半ばから2026年8月までに実施した複数の調査を横断して分析した。
2025年に始めたLongitudinal Expert AI Panel(LEAP)の初期参加者は、計算機科学者76人、AI産業の専門家76人、経済学者68人、政策研究者119人の計339人だった。
これとは別に、過去の予測成績を基に選ばれた超予測者も参加している。
ただし、今回の分析で「専門家」と呼ばれる回答者が、すべての設問で同じ人物というわけではない。
また、今回の発表はすべての予測を採点した査読済み論文ではなく、著者らが代表的と判断した設問を取り上げた途中報告である。
最も大きく外れたのはAIベンチマーク
2022年の予測で特に大きな差が生じたのが、国際数学オリンピック(IMO)の金メダル水準にAIが到達する時期だった。
FRIによると、専門家による予測の中央値は2030年、超予測者は2035年だった。
これに対し、FRIがAIがその水準に達したと判定したのは2025年7月だった。
専門家の予測より5年、超予測者の予測より10年早かったことになる。
この2022年調査はChatGPTの公開前に行われているため、その後に起きた急速なAI開発の進展を予測できなかった可能性はある。
しかし、大きなずれはChatGPT登場後に実施された、より新しい予測にも見られる。
数学ベンチマーク「FrontierMath」の比較的難易度が低い第1〜3層について、LEAPでは「2025年末までに最高性能のAIモデルがどの程度の正答率を達成するか」を尋ねていた。
予測中央値は専門家が31%、超予測者が30%だった。
FRIが最終的に採用した値は40.7%だった。
コード生成ベンチマーク「LiveCodeBench Pro(Hard)」では、2026年末時点の最高正答率について、専門家の予測中央値が14%、超予測者が12%だった。
ところが、2026年5月の時点ですでに最高値は53.8%に達していた。
ただし、どちらの数字にも注意が必要だ。
FRIによると、FrontierMathでは後になって問題の約42%に誤りが見つかり、得点が補正された。
40.7%は、回答者が予測した当時の条件に合わせるため、FRIが採用した補正前の値だ。どの数字を最終的な比較値として使うべきかについては、議論の余地が残る。
LiveCodeBenchについても、設問が尋ねているのは2026年末の値であり、53.8%は5月時点の途中経過だ。
さらにFRIは、過去に出題された問題へ後からモデルを適用できるという評価条件を、一部の回答者が十分理解していなかった可能性も挙げている。
AIの性能が予測より速く伸びたこと自体は明瞭だが、評価方法や比較条件を無視して数字だけを並べることはできない。
「予測が外れた」を3段階に分けて見る
FRIが取り上げた事例は、結果の確定度が同じではない。
FrontierMathは期限を過ぎて結果が確定した設問、LiveCodeBenchは期限前の途中経過、自動運転については将来を推定した値だ。
| FRIが取り上げた設問 | 予測中央値と比較対象 | 2026年9月時点の位置付け |
|---|---|---|
| 2025年末のFrontierMath第1〜3層 | 専門家31%、超予測者30%に対し、FRI採用値40.7% | 期限到来後の確定扱い。ただし問題の誤りが判明する前の未補正値 |
| 2026年末のLiveCodeBench Pro(Hard) | 専門家14%、超予測者12%に対し、2026年5月時点で53.8% | 期限前の実測値。年末の最終結果は未確定 |
| 2027年の米国配車サービスに占める自動運転車の割合 | 専門家7.3%、超予測者2%に対し、FRIによるLLM推計2.5% | 実績ではなく将来予測。過大予測との判断は暫定的 |
分類の基準は単純だ。
FRIが定めた期限をすでに過ぎ、最終結果として採用された値なのか。期限前に観測された途中経過なのか。それとも、これまでの実績や報道を基にLLMが推定した将来値なのか。
3つは対象も単位も異なるため、予測誤差の大きさを単純に比較することもできない。
特に自動運転の2.5%は、2027年の実績ではなく、FRIが現時点で算出した推計値にすぎない。
途中段階で予測を評価することには、もう一つ注意点がある。
AIの性能が予測中央値を早い段階で上回れば、その時点で「過小予測だった」と判断できる。
一方、予想より進歩が遅かったと確定するには、予測期限を迎えるまで待たなければならない。
そのため、期限前の設問を含めた途中評価では、構造的に「過小予測」の事例が見つかりやすい。
FRI自身も、多くの設問はまだ結果が出ておらず、今回の方法にはこうした偏りがあると認めている。
また、中央値を中心に比較すると、実際の結果をかなり正確に予測していた一部の回答者の存在も見えにくくなる。
AI企業の売上と、社会での利用拡大は別の話
AI企業の収入についても、実際の成長が予測を上回っている可能性がある。
FRIは「2026年末までにAI企業が記録する最高の年間経常収益(ARR)」を尋ねていた。
予測中央値は、AI専門家が200億ドル、経済学者が160億ドル、超予測者が250億ドルだった。
FRIはこれに対し、9月時点のAnthropicについて報じられている約1000億ドルの年率換算収入を挙げ、当初の予測を大きく上回る可能性を指摘している。
ただし、この比較もまだ確定したものではない。
1000億ドルという数字は、現時点の収入ペースを年間に換算した報道値だ。
一方、予測で尋ねられたのは2026年末に記録されるARRである。
現在の収入ペースと、年末に確定する会計上の指標を比べているため、数字の差をそのまま最終的な予測誤差とみなすことはできない。
社会全体でのAI利用を見ると、また違った傾向が出ている。
米国の労働時間のうち、生成AIによる支援を受けた割合について、2025年時点の予測中央値は専門家が4%、超予測者が3.6%だった。
FRIが最終結果として採用した値は5.7%だった。
こちらも予測を上回ったものの、企業収入ほど大きな差ではない。
さらに、回答者に提示されていた従来の基準値2%は、その後の研究改訂によって3.35%へ引き上げられた。
回答者が実際より低い出発点を示された状態で予測していたことも、結果に影響した可能性がある。
AI企業1社の売上が急増することと、社会全体でAIを使う時間が同じ速度で増えることは同じではない。
現実の作業では、AIの効果を過大評価した例も
すべての予測がAIの進歩を過小評価していたわけではない。
生物学に関する実験室作業では、むしろAIの効果を実際より大きく見積もっていた。
FRIが紹介したランダム化比較試験では、理工系学生が3つの課題すべてを時間内に完了できた割合は、LLMとインターネットを利用できるグループで5.2%、インターネットのみを利用できるグループで6.6%だった。
両群の差は統計的に有意ではなかった。
一方、事前の予測中央値では、LLMを使えるグループの達成率が27%、インターネットのみのグループが12%と見積もられていた。
つまり回答者は、AIによって実験課題の成功率が大きく上がると予想していたが、実際にはその効果は確認されなかった。
ただし、この実験が測定した範囲は限られている。
当時利用できたモデルを使い、決められた時間内に特定の3課題を完了できるかを調べたものであり、生物学全般におけるAIの能力を評価したわけではない。
将来のより高性能なモデルが、危険性のある実験などを支援できないことを示したものでもない。
それでも、この結果から分かることはある。
ベンチマークで高い成績を収めることと、人間がAIを使って実際の作業をうまく遂行できることの間には、大きな隔たりがあり得るということだ。
AIの能力評価を、そのまま現実世界での生産性や成果に置き換えて考えることはできない。
長期予測の正しさを判断できるのはまだ先
FRIが集めた予測のうち、雇用、GDP、AIによる重大な被害など、社会への影響に関する多くの設問はまだ結果が出ていない。
FRIが2025年に発表した別のXPT研究でも、2022年に集めた予測のうち、2025年半ばまでに結果が確定した38の短期設問を分析している。
その結果、短期的な予測の正確さと、長期的な存亡リスクに関する見積もりとの間には、統計的に有意な相関が確認されなかった。
これは、AIによる長期的な危険が小さいことを意味するものではない。
反対に、短期のAIベンチマークを外した専門家ほど、長期的な社会影響についても間違っていると判断できる根拠が、現時点では乏しいということだ。
AIの能力を測るベンチマークは急速に更新される。
一方、人や企業がAIをどの程度使うのか、雇用や生産性がどう変わるのか、どのような便益や被害が生じるのかを確認するには、それぞれ異なる指標と時間が必要になる。
今後、予測期限を迎えた設問を、目立った事例だけでなく全体として採点できるようになれば、専門家や超予測者がどの分野でAIの進歩を過小評価し、どの分野では過大評価したのかがより明確になる。
さらに、ベンチマーク性能の予測誤差と、現実の仕事や経済への影響の予測誤差が実際に結び付いているのかを検証できれば、こうした予測を政策や事業計画にどう使うべきかも、より具体的に判断できるようになる。



