Basecamp Researchは2026年9月23日、1億4000万ドルのシリーズC資金調達を発表した。調達した資金は、自然界から収集した遺伝子配列を学習する基盤モデル「EDEN」の次世代版と、患者の体内で細胞を書き換える治療法の開発に充てる。

AIが新しい分子を設計できることと、それを安全な医薬品として使えることの間には、数多くの実験と検証が必要になる。同社の論文と公開パイプラインを照らし合わせると、今回の資金調達で今後どこまで開発を進めようとしているのかが見えてくる。

AD

公開データの偏りを、野外で集めた配列でどう補うのか

EDENが学習するのは文章ではなく、微生物などのDNAを表す塩基配列だ。大型モデルは280億パラメータを持ち、Basecamp Researchが集めた9兆7000億個の塩基トークンで訓練された。

2026年2月に公開されたEDENのプレプリントによると、訓練データには100億を超える新規遺伝子と、既存のゲノムデータベースに登録されていない100万超の種に相当する分類単位が含まれている。これらはモデルの訓練に使われた時点での規模を示す数字であり、今後収集する予定の配列まで含んだものではない。

では、なぜ自ら野外へ出て試料を集めるのか。

同社のBaseDataに関するプレプリントでは、公開配列データベース「Sequence Read Archive(SRA)」に登録された読み取り配列の68%超が、わずか5種類の生物に由来すると分析している。

医学研究ではヒトや実験動物の配列が大量に集まる一方、進化の過程で生まれた多様な酵素を探すための学習データとして見ると、大きな偏りが残る。

なお、この68%という数字はSRAに登録された読み取り配列の件数に占める割合であり、地球上の生物種の68%や、既知の遺伝子の68%を指すものではない。

Basecamp Researchは各地の研究機関と協力し、土壌や海洋などから試料を採取し、得られた遺伝子配列を採取環境の情報と結び付けている。

同社が重視しているのは、ファージと宿主のように、異なる生物同士が進化の過程で築いてきた遺伝的な関係だ。たとえば、特定のDNA配列を認識して遺伝子を挿入する酵素を設計する場合、酵素そのものの配列だけでなく、どのDNA配列を標的としてきたのかという組み合わせも重要な手掛かりになる。

ただし、学習データが多いからといって、それだけで治療薬としての有効性を判断できるわけではない。

THE DECODERの独自取材で、最高技術責任者のPhilipp Lorenz氏は、取材時点で同社が保有するデータ量を約15兆トークンと説明した。論文にある9兆7000億トークンは先にモデルの訓練へ使った量であり、15兆トークンはその後に増えた保有データの総量を指す。

同氏は、保有するGPU計算資源のおよそ3分の1を強化学習の実験に割り当てているとも説明した。ただし、その結果として医薬品候補の性能がどの程度向上したのかを示す数値は公表していない。

同じ取材でLorenz氏は、自社で収集したデータを使って訓練したモデルは、公開データだけで訓練した同じ構成のモデルより、塩基配列を予測する指標で優れた結果を示したと述べている。

ただし、比較に使ったデータセットの詳細や具体的な測定値は公開されていない。次に来る塩基を高い精度で予測できたとしても、その能力から患者へ投与した際の安全性や治療効果を直接判断することはできない。医薬品としての可能性を見るには、モデルの評価値とは別に、実際に生成した分子を使った実験結果を確認する必要がある。

また、独自データを集める仕組みにも別の論点がある。

BaseData論文によると、同社は試料を採取する地域の関係者と契約を結び、データの利用権や利益配分について定めている。収集したデータをAIの訓練に使った段階からロイヤルティを支払える仕組みも導入しているという。

2024年末までに19か国の52の受益者へ商業ロイヤルティを配分したとしているが、論文の該当箇所には支払総額や個別の金額は記載されていない。そのため、利益がどの程度現地へ還元されているのかを外部から詳しく比較することは難しい。

野外調査で得た独自の遺伝子データを競争力の源泉とする同社にとって、試料を継続して集められる体制と、採取地域への利益還元の仕組みは、技術だけでなく事業を続けるうえでも重要になる。

遺伝子挿入の実験では、どこまで確かめられたのか

EDENの応用例の一つが、大型セリン組換え酵素の設計だ。

この酵素は二つのDNA配列を認識して組み換えを起こし、比較的長い遺伝子を挿入できる。Basecamp Researchは、自然界に存在する酵素と、その酵素が認識するDNA配列の組み合わせをモデルに学習させ、指定した標的に作用する新しい酵素を生成した。

現在のCAR-T療法では、患者から細胞を取り出し、体外で遺伝子を導入してから体内へ戻す方法が一般的だ。一方、Basecamp Researchが目指しているのは、患者の体内にあるT細胞へ直接、治療用遺伝子を導入する方法である。

EDENの基礎となる事前学習には、ヒト患者や臨床試験のデータは使われていない。自然界から得た大量の遺伝子配列を学習させ、その後、遺伝子挿入など個別の用途に合わせてモデルを調整する。

その結果、自然界の配列で事前学習したモデルから、ヒトT細胞内で働く酵素候補も得られた。

ただし、ここでは「ヒト細胞内で反応を確認したこと」と、「ヒトゲノム上の新しい標的を狙って設計したこと」を分けて見る必要がある。両者は同じ条件で確認されたわけではない。

EDENプレプリントの図3と本文を、酵素を設計する際に指定した標的と、その後の評価方法で整理すると次のようになる。

設計時の標的 評価した場所 論文が示した結果
細菌由来の既知の標的 細胞を使わない反応試験 生成した176候補の53.6%で有意なDNA組換え活性を確認
細菌由来の既知の標的 ヒト初代T細胞 選んだ20候補の半数で、CD19を認識するCAR遺伝子の挿入を確認
ヒトゲノム上の新しい標的 細胞を使わない反応試験 疾患関連部位など14の標的すべてで、活性を持つ候補を得た

ヒトゲノム上の狙った位置に合わせて設計した酵素については、試験管内で活性が確認された。ただし、その候補を実際のヒト細胞内で評価する作業は、論文時点では今後の課題とされている。

ここには見落としやすい違いがある。

ヒトT細胞でCAR遺伝子の挿入を確認した酵素は、細菌由来の既知の標的を手掛かりに設計した候補だ。一方、ヒトゲノム上の新しい標的では、30塩基の標的配列を指定して新しい候補を作り、細胞を使わない反応試験で活性を確認している。

したがって、前者で示された「20候補の半数」という結果と、後者の活性率を横並びにして性能を比較することはできない。対象とした標的も、試験方法も異なるためだ。

論文でも、新しいヒトゲノム標的に合わせて設計した酵素を関連するヒト細胞で検証することや、意図しない場所への遺伝子挿入が起きないかを調べることを今後の課題として挙げている。

同じモデルからは、抗菌ペプチドの候補も設計された。

論文では、合成した33候補を細菌に対して試験管内で評価し、97%に抗菌活性があったと報告している。ただし、これは感染症の患者を治療できたという結果ではない。

EDENが複数の種類の分子を設計できることと、それぞれの候補が安全で有効な医薬品として成立することは、別々に検証する必要がある。

AD

次に問われるのは、モデルの性能より送達と安全性

2026年9月時点の公開パイプラインには、Basecamp Researchが自社で進める6つの治療プログラムが掲載されている。

血液がんと自己免疫疾患を対象とする体内CAR-T、フェニルケトン尿症向け遺伝子治療、薬剤耐性菌向け抗菌ペプチドの4件はリード最適化の段階にある。固形がん向けCAR-Tと糖尿病向けペプチドの2件は探索段階だ。

この一覧を見る限り、前臨床試験や臨床試験へ進んだプログラムはまだない。

9月の資金調達発表では、複数の分野で有望な前臨床段階の成果が得られているとしている。ただし、論文で示された試験管内や細胞を使った実験結果だけでは、候補物質を患者の体内へ安全に届けられることまでは確認できない。

体内CAR-Tの場合、編集に必要な分子を狙ったT細胞へ届けられるかが重要になる。それだけでなく、ほかの細胞に作用しないか、DNA上の意図しない位置に遺伝子が挿入されないかも調べる必要がある。

論文の著者らも、標的外への遺伝子挿入の評価や、新しい標的向けに設計した酵素を適切なヒト細胞で検証することを今後の課題として挙げている。

Basecamp Researchは、自然界に存在する多様な遺伝子配列をAIの学習データとして活用し、狙った標的に合わせて酵素や抗菌ペプチドを設計するところまでは示した。

今回調達した1億4000万ドルが実際の治療法につながるかどうかを判断するうえで重要になるのは、モデルのパラメータ数や学習データ量だけではない。

ヒトゲノム上の新しい標的に合わせて設計した酵素が、実際のヒト細胞内でも狙った場所へ遺伝子を挿入できるのか。意図しない場所への作用をどこまで抑えられるのか。そして、公開パイプラインに並ぶ候補が前臨床試験へ進めるのか。

今後は、そうした実験結果が、EDENの技術が創薬へどこまでつながるのかを示すことになる。