ある論文が科学にどれだけ貢献したかを測る方法として、学界は半世紀以上にわたり同じ手段に頼ってきた。他の研究者がその論文を参考文献として挙げる回数、すなわち被引用数である。

この仕組みの起源は1955年に遡る。情報科学者のEugene Garfieldが『Science』誌に引用索引の構想を発表し、1964年にScience Citation Index(SCI)として実現した。Garfieldの当初の目的は文献検索の効率化だったが、SCIの副産物として生まれた「インパクトファクター」が、雑誌や研究者の評価指標として急速に普及した。1975年にJournal Citation Reportsが公式に開始されて以降、被引用数は科学の評価における事実上の通貨となった。

この通貨には、しかし構造的な欠陥がある。論文が読まれてから引用されるまでには、読者が内容を理解し、自身の研究に取り込み、論文を執筆し、査読を経て出版するという長い連鎖が必要だ。コーネル大学の情報科学者Yian Yinは「ほとんどの論文は公開後1、2日で読まれるが、引用が始まるのは3年、場合によってはそれ以上かかる」と述べている。

AD

「読まれた」という痕跡が先に届く

被引用数の遅延を補おうとする試みは以前からあった。2010年、Jason Priemらが「altmetrics(代替指標)マニフェスト」を発表し、Twitterでの言及やMendeleyの保存数、ダウンロード数などを評価指標として提案した。ダウンロード数と被引用数の相関を示す研究も蓄積されてきた。ある先行研究では、『Tetrahedron Letters』誌の論文についてダウンロード100回あたり約1回の引用という比率が報告されている。Mendeleyの読者数を用いた研究では、公開後6ヶ月以内に読者がついた論文は、そうでない論文に比べて5年後の被引用数が約34.7%多いという結果も出ている。

しかし、これらの研究には共通の限界があった。データが小規模であるか、特定の雑誌や分野に限定されているか、あるいはダウンロードと引用の時間的な前後関係を厳密に追えないかのいずれかだった。「ダウンロードが引用に先行する」という直感的に妥当な仮説を、数百万本規模で、時間分解能を持って検証できる標準的なデータセットが存在しなかったのだ。

「リード・ラグ予測」という新しい問題設定

コーネル大学Ann S. Bowers計算情報科学部のYinとSarah Deanらのチームは、この空白を埋めるアプローチを取った。彼らは既存の予測手法を発明したのではなく、まず問題そのものを定式化した。「リード・ラグ予測(Lead-Lag Forecasting, LLF)」である。

定義は明快だ。早期の利用チャネル(リード)から、時間的にずれて現れるインパクトのチャネル(ラグ)を予測する。arXivの場合、リードはダウンロード数、ラグは被引用数。GitHubの場合、リードはプッシュやスター、ラグはフォーク数である。

チームはarXivの協力を得て、2006年7月から蓄積された匿名化されたアクセスログを取得した。生のダウンロード数は48.7億件にのぼる。このうち約44%をボットによるアクセスと判定して除去し、約230万本の論文ごとのアクセス時系列を構築した。次に、Semantic Scholarのデータ(約2億2000万本の論文、約26.6億件の引用関係)と照合し、各論文の引用時系列を推定した。最終的に、アクセスと引用の両方の時系列を持つ約200万本の論文が解析対象となった。

GitHub側では、GH ArchiveのイベントデータとEcosyste.msのパッケージメタデータを結合し、約300万のリポジトリについてプッシュ、スター、フォークの時系列を構築した。

AD

30日間のデータで5年後の「当たり」を引けるか

データセットの検証結果は、リード・ラグ構造の存在を明確に示した。arXivの全コーパスにおいて、最初のアクセスは常に最初の引用より前に発生する。アクセス数と5年後の被引用数の間のPearson相関は、公開直後から立ち上がり、日を追うごとに強くなる。一方、早期の引用数と5年後の被引用数の相関がアクセスを上回るのは、公開後約50日を過ぎてからである。

予測タスクとして定量化すると、この構造はさらに鮮明になる。チームは「5年後に被引用数50回以上(上位8.1%)に達する論文を、早期のデータだけで識別できるか」という二値分類問題を設定した。

観測期間 特徴量 AUC(ダウンロード→引用) F1スコア ランダムベースラインAUC
30日 累積ダウンロード数のみ 0.80 0.31 0.50
100日 累積ダウンロード数のみ 0.83 0.35 0.50
365日 累積ダウンロード数のみ 0.86 0.39 0.50
365日 Time-MoE埋め込み+ロジスティック回帰 0.88 0.39 0.50

公開からわずか30日、つまり1ヶ月分のダウンロード数だけで、AUC 0.80に達する。これは、ランダムに選んだ場合(0.50)を大幅に上回り、5年先の「高被引用論文」をかなり正確にランク付けできることを示す。時系列基盤モデルTime-MoEの埋め込み特徴を使うと、365日でAUC 0.88まで改善する。

GitHub側でも同様のパターンが確認された。早期のスター数が5年後のフォーク数と最も強い相関を示し、早期のフォーク数そのものよりも予測力が高い。中央値のリポジトリは最初のスターを公開後10〜30日で得るのに対し、最初のフォークは100〜200日後にようやく発生する。

なぜダウンロードは引用より「速い」のか

この非対称性の背景には、科学的な情報処理の段階構造がある。論文を読む行為は、その内容が自分の研究に必要かどうかを判断する最初のステップだ。一方、引用は、読んだ内容を自分の研究に組み込み、論文を書き、査読を経て出版するというはるかに長いプロセスの最終段階に位置する。ダウンロードは「関心の表明」であり、引用は「関心の成果物」である。両者の間に横たわる時間差が、リード・ラグ構造を生み出している。

Yinはこれを「予測市場のようなもの」と表現する。ただし、科学者は金銭ではなく注意力を「投票」に使っている。誰かが論文をダウンロードするという行為は、その論文が将来重要になるという集団的な予測の集積なのだ。

AD

データセットが拓くものと、まだ見えないもの

この研究の貢献は、予測精度そのものよりも、問題の定式化とデータ基盤の提供にある。時系列予測のコミュニティにおいて、リード・ラグ予測はこれまで統一された問題として扱われてこなかった。標準的なベンチマークデータセットが存在しなかったためだ。今回のデータセットは、訓練用93.8万本、検証用23.5万本、テスト用23.5万本という分割を提供し、後続の研究が再現可能な比較を行える環境を整えた。

ただし、未解決の問いは多い。第一に、F1スコアが0.31〜0.39にとどまるという事実である。AUCは高くても、実際の閾値で「高被引用」と判定したときの適合率と再現率のバランスはまだ粗い。第二に、ダウンロードと引用の関係が因果なのか相関なのかは、このデータセットだけでは判定できない。優れた論文が多くダウンロードされ、同時に多く引用されるという共通原因の可能性は排除されていない。第三に、arXivは物理学、数学、コンピュータサイエンスに偏ったプレプリントサーバーであり、生物医学や社会科学への一般化は検証されていない。第四に、ボット除去の精度(約44%を除去)が結果にどの程度影響するかは、感度分析の対象として残されている。

Yinは応用の展望について「COVIDの際、経済学者は解決策を1日でも早めることが数百億ドルの価値を持つと推定した。フロンティアが次にどこへ動くかを、たとえ数日でも先に察知できる者は、企業であれ、資金提供機関であれ、国家であれ、競争優位を得る」と述べている。ダウンロードのログが科学の未来を映す鏡だとすれば、その鏡の解像度を上げることが次の課題となるだろう。