Biohubは2026年10月7日、細胞の反応を予測するAIの学習に必要なデータを整備する「Virtual Biology Initiative」の拡大を発表した。Google DeepMind、Isomorphic Labs、Metaの3社が共同で3億ドルを投資し、米エネルギー省(DOE)と米国立衛生研究所(NIH)も参加する。新たな資金に既存データや計算資源などを加えた協力全体の規模は、18億ドルに達するという。

Biohubが4月に立ち上げたこの構想は、民間主導の研究支援から、米政府機関の実験施設やデータ基盤も活用する取り組みへと発展した。目指しているのは、実験データを学習し、遺伝子の働きなどを変えた際に細胞がどう反応するかを予測する「仮想細胞」の実現だ。そのためには、単に大量の細胞を観察するだけでなく、何を変えた結果、どのような変化が起きたのかを比較できる実験データが欠かせない。

AD

18億ドルの内訳から見える協力の実態

Google DeepMind、Isomorphic Labs、Metaの3社による投資額は合計3億ドルで、各社の負担割合は公表されていない。一方、政府機関が提供する資源は、それぞれ性質が異なる。DOEは今後の計測や計算に資金を投じ、NIHは過去の研究投資によって整備されたデータなどを提供できるよう調整する。

Biohubが発表した18億ドルには、新たな資金だけでなく、既存データや計算資源などの価値も含まれている。 10月7日の発表と4月の開始発表を基に、各機関の拠出額や提供する資源を整理すると、次のようになる。

主体 発表された金額 時期・期間 主な支援内容
Biohub 5億ドル 2026年4月に表明した5年間の投資計画 計測技術やデータ生成に4億ドル、外部研究支援に1億ドル
Google DeepMind・Isomorphic Labs・Meta 3社合計で3億ドル 2026年10月の拡大発表 予測モデルの基盤技術の開発と、複数の計測手法を組み合わせたデータの整備
DOE 5億ドル超 5年間 実験計測、モデル開発、計算処理などへの投資
NIH 過去の連邦政府による5億ドル超の投資で整備された資源 過去の研究投資による既存資源 データセットやリポジトリ、知識基盤の提供を調整し、Biohubと協力して学習用データを標準化

金額はいずれも米ドルだが、対象期間も提供する資源の性質も異なる。特に、NIHが提供する既存資源の価値を新たな現金支出と同列に扱うことはできない。18億ドルという数字は、Biohubが公表した協力全体の規模として捉える必要がある。

DOEの役割も、計算能力の提供だけではない。「Genesis Mission」を通じて国立研究所のスーパーコンピューターを活用するとともに、X線・中性子散乱やクライオ電子顕微鏡による計測を組み合わせる。自律実験施設の利用も計画しており、細胞の計測とAIモデルの学習の両面を支援する。

NIHによる既存データの標準化も合わせると、今回の連携は、新たな実験データを生み出す取り組みと、蓄積された研究成果をAIの学習に活用するための基盤整備を一体化するものといえる。

細胞を大量に観察するだけでは、反応を予測できない

Biohubが拡充しようとしているのは、遺伝子操作などの介入に対して、細胞がどのように反応するかを記録したデータだ。対象となる細胞の種類や実験条件を増やすとともに、細胞同士の相互作用も調べる。ある細胞でどの遺伝子が働いているかを把握する段階から、その働きを変えたときに何が起きるかを予測する段階へ進むことを目指している。

例えば、同じ遺伝子の働きを抑えても、細胞の種類が違えば同じ変化が起きるとは限らない。AIモデルを実験計画に役立てるには、細胞の種類や介入内容と、実際に観察された反応を正確に対応づける必要がある。測定する細胞の数を増やしても、こうした対応関係が曖昧なままでは、未知の条件に対する予測精度が向上するとは限らない。

そこでBiohubは、分子レベルの情報に加え、細胞内の構造や位置関係、時間とともに変化する状態まで捉えようとしている。

当初の5億ドルの投資計画のうち、計測技術などに充てる4億ドルには、細胞内部を原子レベルに近い解像度で観察するクライオ電子線トモグラフィーや、生きた組織内の数百万〜数十億個の細胞を撮像する顕微鏡の開発支援が含まれる。ただし、これらは今後の技術開発目標であり、今回の発表時点ですでに達成された計測能力を示すものではない。

測定方法が増えるほど、異なる実験で得られたデータを統合する難しさも増す。Biohubは共通のデータ規格と識別子を整備し、単一の窓口からデータにアクセスできる仕組みを構築する方針を示している。

どの細胞を、どのような条件で測定した結果なのかを統一された形式で記録すれば、異なる研究施設で得られたデータも比較しやすくなり、AIモデルの学習に活用できる範囲が広がる。新たな計測技術への投資と、データを統合するための標準化は、切り離せない取り組みなのだ。

AD

未知の細胞でも予測は通用するのか

現在の細胞応答予測モデルが抱える課題は、Arc Instituteが実施する「Virtual Cell Challenge」の結果からも見えてくる。これはBiohubの今回の投資効果を検証するものではなく、細胞への介入によって生じる変化をAIモデルがどこまで予測できるかを競う公開コンペティションだ。

Arcの2025年大会の報告によると、評価には「H1」と呼ばれるヒト胚性幹細胞から得られた、約30万件の単一細胞RNA発現データが使われた。データには、300種類の遺伝子をそれぞれ抑制するCRISPRi実験の結果が含まれている。

参加者は、同じ細胞株で得られた一部の遺伝子抑制実験データを使ってモデルを学習させ、学習データに含まれていない介入によって遺伝子発現がどう変化するかを予測した。

結果は、評価指標によって明暗が分かれた。異なる介入による反応を識別する指標や、発現量が増減する遺伝子を特定する指標では改善が見られた。一方、予測値と実測値のずれを測る平均絶対誤差(MAE)では、ほぼすべてのモデルが単純な基準手法を下回る成績だったとArcは報告している。

ただし、MAEの結果だけで「予測モデルは役に立たない」と結論づけることもできない。

Arcは、測定時のノイズや遺伝子発現の検出漏れ、細胞間のばらつきなどが評価結果に影響すると説明している。こうした条件では、平均的な細胞状態をそのまま予測値とする単純な手法を上回ることさえ難しい。

介入によって生じる変化のパターンを見分ける能力と、その変化の大きさを正確に予測する能力は、分けて評価する必要がある。

2026年大会では、さらに一歩進み、異なる細胞条件でも予測が通用するかを検証する。

対象となるのは、異なる組織に由来する6種類の細胞株だ。今回は大会専用の学習データを提供せず、参加者には遺伝子抑制を行っていない対照細胞の遺伝子発現データと、抑制対象となる遺伝子の識別子だけが渡される。介入後の実測データは公開されず、予測結果を採点する際の正解として使用される。

つまり、参加者は対象となる細胞の通常の状態を把握できるものの、その細胞に介入した際の反応を学習することはできない。ほかの細胞や実験から得られた知識を使い、未知の条件における反応を推定する仕組みだ。

培養や実験が難しい細胞の反応を調べたい研究者にとって、こうした未知の条件への対応力は特に重要になる。ただし、2026年大会はまだ進行中であり、この評価方法が採用されたこと自体は、モデルの予測能力が実証されたことを意味しない。

商業パートナーには1年間の独占利用期間

今回の構想では、商業パートナーが生成するデータの公開時期にも注目する必要がある。

AxiosがBiohubの科学責任者Alex Rivesに取材したところ、商業パートナーは自ら生成したデータを、一般公開に先立って1年間、独占的に利用できるという。企業が資金を提供する動機を確保するための仕組みとして説明されている。Axiosの取材記事

つまり、Biohubが公開データ基盤の整備を掲げていても、すべての研究者が同時にデータを利用できるわけではない。

先行利用を認められた企業は、一般公開を待つ研究者よりも早く、モデルの学習や評価に着手できる可能性がある。ただし、この時間差がモデルの性能にどの程度の差をもたらすかは、現時点では明らかになっていない。

研究者がデータの利用を検討する際には、どのデータが、いつ、どのような条件で公開されるのかを確認する必要がある。共通規格が整備されていても、検証に必要な介入データへアクセスできなければ、モデルの性能を十分に評価できない場合があるためだ。

AD

仮想細胞を研究に役立つ道具にするには

今回Biohubが発表したのは、データ生成と研究基盤の整備に向けた連携の拡大だ。新たな汎用細胞モデルの性能や、治療効果が実証されたわけではない。

今後のモデル開発を左右するのは、研究者が調べたい細胞の種類や介入条件について、どれだけ実験データを収集できるか、そして、それらを既存データとどこまで統合できるかという点になる。

Arcの評価方法が示すように、モデルの実用性を確かめるには、学習データに含まれていない介入への反応を予測し、その結果を実測値と照合する必要がある。

反応のパターンを識別できれば十分なのか、それとも変化の大きさまで正確に予測する必要があるのかは、研究の目的によって異なる。大量の細胞データを集めることと、研究者が求める答えを得ることの間には、こうした具体的な性能評価が欠かせない。

異なる条件で得られたデータが比較可能な形式で公開され、未知の反応に対する予測を外部の研究者も実測値と照合できるようになれば、仮想細胞は次に行うべき実験を選ぶための実用的な道具に近づく。

18億ドル規模の構想の成否を分けるのは、どれだけ大量の細胞データを集めたかではなく、そのデータから、実験で確かめられる予測をどれだけ生み出せるかだ。