• 何が起きたか: NASAとIBMが、LROによる17年分の観測データなどを使って開発した月面向け基盤モデルと、追加学習・評価に利用できるデータセットやコードを公開した。
  • なぜ重要か: 異なる観測機器や解像度のデータを一つのモデルで扱い、少量のラベル付きデータでもクレーター検出などに活用できる可能性を示した。
  • 今後の注目点: 氷に関する評価は、既存の有望度マップをどこまで再現できるかを測ったものだ。現地測定や別地域での独立検証を通じ、実際の探査にどこまで役立つかを確かめる必要がある。

NASAとIBMは2026年9月10日、月周回偵察衛星LROによる17年分の観測を主要な学習データとした「NASA-IBM Lunar Foundation Model」を公開した。画像や地形、鉱物組成、撮影条件などを学習し、クレーター検出や、氷が存在する可能性の高い地域の推定などに追加学習で転用できる月面向け基盤モデルである。異なる探査機や観測機器のデータを横断的に活用しやすくする試みだ。

ただし、発表で示された「氷の推定で約22%、クレーター検出で約19%向上」という数字は、それぞれ異なる評価指標に基づいている。とりわけ氷の評価で正解として使われたのは、現地で測定した氷の埋蔵量ではなく、専門知識に基づいて作られた既存の有望度マップである。

AD

約200万組の観測データを位置合わせ

月面画像が大量にあっても、そのままAIの学習データとして使えるわけではない。同じ地点でも、観測機器や画素の大きさ、太陽の位置などが異なる。画像と地形、鉱物組成などを組み合わせるには、それぞれの観測データが月面のどこに対応するかを正確にそろえる必要がある。

IBMの公式発表によると、今回のデータ基盤には、9種類の観測機器、4つのミッションから集めた30層を超える空間データが含まれる。LROに加え、重力場を観測したGRAIL、Lunar Prospector、日本の月周回衛星「かぐや」のデータも使われた。「かぐや」の分光観測から得た鉱物組成や、LROのレーザー高度計LOLAを使った地形データなども統合している。単独のカメラ画像だけでは得られない情報を、同じ地点の観測として扱うためだ。

研究チームが構築した「SomBench」は、位置を合わせた観測データを小さな区画に切り出し、対応するデータ同士を組み合わせた学習・評価用データセットである。論文によると、広角カメラWAC由来のデータが約96万4,000組、狭角カメラNAC由来が約100万組含まれる。「約200万組」とは切り出して組み合わせたデータの数であり、200万枚の原画像を意味するわけではない。

WAC画像は約100m/画素、NAC画像は約1m/画素で、捉える空間スケールが大きく異なる。さらにNAC側のデータは、対応する高精細な地形モデルが存在する地点に限られている。月面全体を1m単位で覆ったデータセットではない。

事前学習では、画像として扱う9種類の入力に撮影条件などを加え、計11種類の情報を利用する。元の30層すべてを同じ解像度の画像として読み込むわけではなく、一部の補助データは区画内の平均値などに変換して入力する。解像度の粗い観測を高解像度画像と位置合わせしても、元の観測自体の解像度が高くなるわけではない。

学習用と評価用データの分け方にも工夫がある。区画を無作為に振り分けると、撮影時刻だけが異なる同じ地点の画像が学習側と評価側の両方に入り、評価時に実質的に既知の地形を再び見る可能性がある。そこで地域単位でデータを分割し、同じ場所の観測が学習用と評価用にまたがらないようにした。地理的な位置合わせは、異なる観測を結び付けるだけでなく、評価を過大に見せないためにも使われている。

月面の見え方を左右する太陽の角度も学習

モデルの基本構造には、地球観測向け基盤モデル「TerraMind」の設計が採用された。ただし、地球向けに学習したモデルを月面データで微調整したのではなく、月の観測データを使ってゼロから事前学習している。

学習時には入力の一部を隠し、残された情報から隠れた部分を予測させる。画像、地形、観測条件などを種類ごとに小さな単位へ変換して処理することで、人がすべての画像にクレーターや地質のラベルを付けなくても、異なる観測データ同士の関係を学習できる。その後、用途ごとのラベル付きデータを使って追加学習する。

月面では、太陽の角度によって同じ地形でも影の見え方が大きく変わる。暗く見える場所が物質の違いによるものなのか、単に光の当たり方によるものなのかを、画像だけから見分けるのは難しい。このモデルでは太陽やカメラの角度なども既知の条件として入力し、見え方が変化する要因そのものを学習材料に含めている。

広角画像と狭角画像の扱いも特徴の一つだ。両者を同じ区画に重ねて入力するのではなく、それぞれの解像度を保ったデータ群を同じ学習過程で使い、共通のモデルパラメーターを更新する。約100倍異なる観測スケールを、一つのモデルで扱う設計である。追加学習時には、画像を分割する単位を柔軟に変えられるFlexiViTの手法も利用する。

こうした仕組みは、観測条件や用途の違いに対応するためのものだ。ただし、撮影角度を入力する効果と、異なる解像度を混ぜて学習する効果が、それぞれ性能向上にどの程度寄与したのかを切り分ける比較実験は、論文でも今後の課題とされている。

AD

氷の「有望度マップ」は何を示しているのか

NASAの発表では、月面の揮発性物質や資源の調査への活用も想定されている。氷が存在する可能性の高い場所を絞り込めれば、将来の探査計画に役立つ。ただし、今回の評価が実際に何を測っているのかには注意が必要だ。

氷に関する課題では、月の両極付近を対象に、240m/画素のデータから0〜1の「有望度」を推定する。入力として使うのは、傾斜、斜面の向き、氷が安定して存在できる深さ、最高温度、永久影領域、影の密度、影までの距離、地形の曲率という8種類の情報である。

ここで正解として使われた有望度マップも、同じ8種類の情報を専門知識に基づいて組み合わせて作られている。 低温や日陰といった条件を段階的に評価し、それらを統合する「ファジー論理」が使われる。したがって、この試験は未知の地点で実際に測定された氷を言い当てる外部検証ではなく、既存のルールに基づいて作られた地図を、モデルがどの程度再現できるかを測ったものだ。

こうした考え方は、地球上の鉱物探査などにも使われている。米地質調査所USGSは2025年7月、月南極のMons Moutonを対象に、日陰や傾斜などの条件から水が存在する可能性の高い場所を絞り込む地図を発表した。現地調査が十分に行われていない段階で、どこを優先的に調べるかを決めるための手法である。

今回の氷データセットの説明にも、参照マップで使われた重み付けには仮定が含まれ、現地観測が増えれば変更される可能性があると記されている。高い値は氷の埋蔵量や純度を表すものではなく、そのまま「氷が見つかる確率」と読み替えることもできない。

AIが参照マップを高精度に再現できたとしても、そのマップを作る際の仮定まで正しいと証明されたわけではない。

このモデルの価値は、多種類の観測データから候補地を絞り込む作業を共通の仕組みで扱える点にある。その候補地に実際に氷が存在するのか、利用できる量や状態なのかを判断するには、別の観測手段や現地での測定が必要になる。

「約22%」「約19%向上」は何を意味するのか

性能評価の根拠は、Paolo Fraccaro氏らによる査読前論文「Multimodal-Multiresolution Foundation Model for Lunar Remote Sensing」に示されている。公開された数値は研究チーム自身のベンチマークによるもので、下表は乱数条件を変えて実行した5回の試行の平均値である。5回の独立した現地観測を行ったという意味ではない。

課題と評価指標 月面基盤モデル 比較モデル 結果の読み方
氷の有望度:RMSE(小さいほど良い) 0.0293 SwinV2-B:0.0377 参照マップに対する誤差が約22.3%小さい
広角クレーター:mAP(大きいほど良い、双方とも学習データ50%) 0.2541 SwinV2-B:0.2313 約9.9%高い
狭角クレーター:mAP(大きいほど良い) 0.1543 SwinV2-B:0.1552 ほぼ同等
不規則な火山地形:IoU(大きいほど良い) 0.5709 ConvNeXtV2-B:0.5687 試行ごとのばらつきを考えるとほぼ同等

月面基盤モデル側では、課題ごとに、モデル全体を追加学習する方法、一部のパラメーターだけを学習する方法、特徴抽出部分を固定する方法などを試し、その中で成績の良い設定を採用している。比較モデルとの評価では、課題内のデータ分割、損失関数、出力部分の構造などはそろえている一方、学習率などの最適化条件は各モデル群に合わせて設定している。すべての条件を完全に同一にした比較ではない。

氷について示された「約22%」は、二乗平均平方根誤差(RMSE)が0.0377から0.0293へ減少したことに対応する。(0.0377−0.0293)÷0.0377で約22.3%となる。平均絶対誤差(MAE)でも、0.0256から0.0197への低下で約23.0%となる。

いずれも予測誤差が減った割合であり、「氷を発見できる確率が22ポイント高まった」という意味ではない。

広角クレーター検出で発表された「約19%向上」はAP@75を使った比較であり、同じ量の学習データを使った場合のmAPの改善率は約9.9%である。

論文の表4で、双方が学習データの50%を使った条件を比べると、AP@75は0.1862から0.2213へ上昇する。0.2213÷0.1862−1は約18.9%となり、発表の「約19%」と対応する。一方、mAPは0.2313から0.2541への上昇で、改善率は約9.9%となる。

AP@75は、検出した領域と正解領域がどの程度重なっているかについて厳しい基準を設けた指標で、mAPは複数の重なり基準で得た結果を平均した指標である。同じ検出結果でも、使う指標によって改善率は変わる。

また、「半分のデータで19%向上」という説明を、月面基盤モデルが半分のデータ、比較モデルが全データを使った結果だと解釈することもできない。

ただし、少量のラベル付きデータを有効に使える可能性は示されている。広角クレーター検出では、月面基盤モデルが50%の学習データで得たmAP 0.2541が、SwinV2-Bが100%の学習データで得た0.2420を上回った。この課題に限れば、人がラベルを付ける作業を減らせる可能性を示す結果といえる。

一方、狭角クレーター検出や火山地形の分類では、強力な比較モデルを大きく上回ったわけではない。IBMが示している火山地形での約3%改善も、SwinV2-Bとの比較による数字であり、表に示された最も成績の良い比較モデルとの差とは分けて考える必要がある。

AD

公開モデルを実際の研究に使うには

公開されたモデルの重みとコードを使えば、研究者は自分の研究課題に合わせて追加学習を試せる。クレーター検出では、モデルの大部分を固定し、少数の追加パラメーターだけを学習するLoRAでも競争力のある性能を示した。

ただし、特徴抽出部分を完全に固定しただけでは、クレーター検出の性能は低下した。用途に応じた調整は必要になる。

また、氷の課題では、事前学習をしていない同じ構造のモデルでも、多くの比較モデルを上回った。入力の種類ごとに異なる処理を行うモデル構造そのものが性能に寄与している可能性があり、改善のすべてを「17年分の月面データで事前学習した効果」とみなすことはできない。

評価対象の広さにも限界がある。氷の試験は25区画、火山地形の試験は10区画と規模が小さい。モデルカードも、着陸地点の認定など、実際のミッション運用での利用は検証されていないとしている。

生成された地形についても、形状は似ていても標高の絶対値がずれる例や、生成した緯度・経度が実際の位置から数十度ずれる場合が報告されている。観測データ同士の関係を学習できることと、その出力を測量値としてそのまま利用できることは別の問題である。

モデルの重みと追加学習・推論用コードはApache-2.0ライセンスで公開されている。設定ファイルに加え、学習用データセットや評価課題も公開された。ただし、GitHubの説明には、事前学習用のコードは含まれていないと明記されている。

そのため、公開済みの重みを使った研究や追加学習は始められる一方、モデルの事前学習工程そのものを同じ条件で完全に再現できるわけではない。

今後、異なる地域や照明条件でも性能が維持されるかを独立した研究で確かめ、氷の候補地を新たな観測結果と照合できれば、共通の基盤モデルを使う利点はより明確になる。とりわけ氷の評価では、モデルの予測精度を高めるだけでなく、現地測定によって参照マップそのものの仮定を更新していくことが、実際の探査判断へ近づくための重要な条件になる。