米下院のRo Khanna議員がOpenAI、Anthropic、Google、Meta、SpaceXAIの5社に対し、AIモデルの「重み」を中国などからの不正アクセスや窃取からどう守っているか説明を求める書簡を送った。Reutersが2026年10月1日に報じた。4月29日には、Jim Banks上院議員とChuck Grassley上院議員も、AI企業9社のCEOに対し、モデルの重みを保護する方法などについて書面で回答するよう求めていた。重みとは、AIが学習を通じて調整した数値(パラメーター)の集まりで、モデルの能力を左右する重要なデータだ。顧客情報や社内文書が流出する一般的な情報漏洩とは、盗まれるものが根本的に異なる。では、企業が独自に追加学習したモデルの重みが流出すると、何が起きるのか。最先端のAIを開発する企業を想定したセキュリティ対策は、一般企業にも有効なのだろうか。

AD

重みが流出すると、学習済みモデルそのものが盗まれる

米シンクタンクのRAND Corporationは、2024年の報告書「Securing AI Model Weights」で、重みを「AIの中核的な知能を符号化した学習可能なパラメータ」と定義している。膨大な計算資源と時間を費やした学習の成果が、数値データとしてファイルに保存されている。これを対応する推論環境に読み込めば、学習済みモデルとして動作させることができる。

一般的なデータ漏洩で持ち出されるのは、顧客名簿や社内文書などの情報だ。一方、重みが流出すると、学習を終えたモデルそのものが第三者の手に渡る。

クラウドセキュリティの業界団体Cloud Security Alliance(CSA)は、2026年5月17日に公開した研究ノートで、高速回線があれば重みは数時間でコピーでき、十分なGPU環境を持つ攻撃者なら、追加の学習投資をせずに数日で盗んだモデルの提供を始められると指摘している。ただし、この所要時間は独立した検証で確認されたものではなく、CSAによる見積もりだ。

同じ研究ノートでは、基盤モデルの重みが一度流出すれば、数年にわたる研究開発と数億ドル規模の計算コストに相当する成果が、開発費を負担していない攻撃者の手に渡る可能性があるとも警告している。

米上院議員の書簡も、こうした重みの価値を問題視している。Banks議員とGrassley議員は、AIモデルの重みが中国に渡ることについて、設計図を盗まれるというよりも「完成したAI製品」を盗まれることに近いと表現した。

これに対して、AIモデルの「蒸留(distillation)」は仕組みが異なる。他社のAIモデルにAPI経由で大量の問い合わせを行い、得られた出力を使って自社モデルを学習させる手法だ。相手のサーバーに侵入する必要はなく、モデルの振る舞いを模倣できる一方、元のモデルの重みをそのまま取得できるわけではない。

実際、Anthropicは2026年2月23日、DeepSeek、Moonshot、MiniMaxの中国3社が約2万4000の不正アカウントを使い、Claudeに対して1600万回以上のやり取りを行い、蒸留を試みたと公表した。これはモデルの出力を利用した事例であり、重みそのものを盗んだわけではない。

重みの流出、蒸留、そしてファインチューニングに使用したデータの抽出について、持ち出される情報と攻撃の成立条件を比較すると、次のようになる。

種類 持ち出されるもの 必要なアクセス・条件 攻撃者ができること
重みの流出 学習済みモデルのパラメーター(RANDの定義) 推論サーバーの掌握など(論文の想定) GPU環境があれば、追加学習なしで数日以内に提供を開始できる可能性がある(CSAの見解)
蒸留 APIから得られる出力(Anthropicの公表事例では約2万4000アカウント、1600万回以上) インフラへの侵入は不要(CSA) 元のモデルの能力や振る舞いを模倣。ただし重みそのものは再現できない
学習データの抽出 ファインチューニングに使用した問い合わせデータ バックドアを仕込んだ基盤モデルの作成者が、追加学習後のモデルにブラックボックスでアクセス(ICLR論文) 実用的な実験条件で5000件中最大76.3%を完全に抽出(同論文)

このように、3つの攻撃は持ち出される情報も、必要なアクセスも異なる。

蒸留では他社モデルの応答を手本に新しいモデルを学習させるが、元の重みは得られない。学習データの抽出で狙われるのは、ファインチューニングに使用された入力データだ。これに対して重みの流出では、適切な実行環境さえあれば動作する学習済みモデル自体が第三者の手に渡ってしまう。

米議会がAI企業に説明を要求、4月の9社に続き10月には5社を対象に

2026年4月29日、Banks議員と上院司法委員長のGrassley議員は、OpenAI、Anthropic、Google、xAI、Meta、Microsoft、Amazon、Safe Superintelligence、Thinking Machines Labの9社のCEOに書簡を送付し、5月26日までに書面で回答するよう求めた。

質問は従業員の身元審査や内部脅威の検知にも及んでいる。モデルの重みに関しては、中国の脅威主体による窃取を十分に防げると考えているか、重みや関連する機密資産に特権アクセスを持つ従業員は何人いて、その人数がどう変化しているかを尋ねた。

さらに、中国に関連する主体による持ち出しを検知、あるいは疑った場合と、自社のAIモデルやエージェントが持ち出しを試みた場合について、それぞれ米政府に通知する方針があるかも質問している。

一方、Reutersによると、Khanna議員が5社のCEOに送った書簡では、重みへの不正アクセスや窃取を狙った既知の事例に加え、そうした攻撃を防ぐためのサイバーセキュリティ対策について説明を求めている。

Khanna議員は、米下院の中国問題特別委員会で民主党筆頭委員を務める。Reutersの取材に対し、各社からすぐにコメントは得られなかったという。同議員は、中国によるモデルの重みの窃取について、「キーボードをひとたたきするだけで、米国のAI分野における優位性を損ないかねない」と警告している。

これまでの研究や企業の発表、議会の動きを時系列で整理すると、次のようになる。

日付 出来事 主体
2024年 38の攻撃経路と5段階のセキュリティ水準を示す「Securing AI Model Weights」を公表 RAND
2025年11月4日 推論時の応答に隠された重みの持ち出しを検知する研究論文の初版をarXivに公開 Roy Rinbergら
2026年2月23日 中国3社によるClaudeの蒸留を公表 Anthropic
2026年4月29日 AI企業9社のCEOに重みの保護体制を問う書簡を送付(回答期限は5月26日) Banks上院議員、Grassley上院議員
2026年5月17日 AI開発企業を対象とした脅威モデルの研究ノートを公表 CSA
2026年10月1日 Khanna議員が5社のCEOに重みの窃取を狙う行為と防御策について照会したと報道 Reuters

いずれも議員による書面での照会であり、新たな法律や規制が決まったわけではない。また、Khanna議員の書簡本文は確認できておらず、その内容についてはReutersが報じた範囲に限られる。

AD

AIの応答に重みを隠して持ち出す攻撃、論文が示した検知方法

Harvard大学とMATSに所属するRoy Rinbergら5人の研究チームは、2025年11月4日に論文「Verifying LLM Inference to Prevent Model Weight Exfiltration」の初版をarXivで公開し、2026年3月12日に第3版へ改訂した。共著者のKeri WarrはAnthropicに所属している。

この研究が目指すのは、RANDが定義した5段階のモデル保護水準のうち、「SL3」から「SL4」への引き上げだ。SL3はサイバー犯罪組織や内部関係者による攻撃を阻止できると想定される水準で、SL4は高度なサイバー攻撃能力を持つ組織による一般的な作戦の大半を防げるとされる水準だ。

研究チームが想定しているのは、推論サーバーを乗っ取った攻撃者が、利用者に返す通常の応答に重みのデータを紛れ込ませ、外部に送信する攻撃だ。

こうした情報の隠蔽手法は「ステガノグラフィ」と呼ばれる。データの中に別の情報を埋め込み、一見すると通常の通信に見える形で秘密情報を運ぶ技術だ。

論文では、大規模な推論サービスを運営するデータセンターでは、通常の業務だけでも1日に数百GBのデータを送受信する必要があり、攻撃者がこの通信を隠れ蓑にする可能性を指摘している。この通信量の根拠にはRANDの報告書が引用されている。

ただし、これは研究チームが設定した攻撃シナリオであり、実際に同じ方法でモデルの重みが盗まれた事例を報告したものではない。Reutersも、重みそのものが窃取されたと公に確認されている事例は少ないと伝えている。

論文では、重みの持ち出しを所要時間によって3つに分類している。人間が対応する前に完了する高速型、数日から数週間をかける中間型、数カ月から数年にわたって少しずつ持ち出す低速型だ。

大量のデータを短時間で送信すれば検知されやすい。一方、極端に少量ずつ持ち出す方法では、攻撃者にとっても時間がかかりすぎるおそれがある。そこで検知システムを導入すれば、攻撃者は検知される危険を冒して大量に送信するか、検知を避けるために持ち出し速度を落とすかの選択を迫られる。研究チームは、後者の攻撃をどこまで抑えられるかに着目した。

提案された検知方法の中心となるのが、推論結果の再実行と照合だ。

まず、推論サーバーへの入力、生成された出力、乱数のシード値を記録する。そして、外部から隔離された検証サーバーが一部の処理を選び、同じ条件で推論を再実行する。

LLMは同じ入力を与えても、サンプリングに使う乱数や浮動小数点演算の違いによって、出力がわずかに変化することがある。そのため、検証サーバーは単に結果が完全一致するかを見るのではなく、生成された各トークンが、正規のモデルで起こり得る変動の範囲に収まっているかを推定する。

研究チームの着眼点は、重みの情報を応答に埋め込もうとすると、通常のモデルが生成する出力の傾向から何らかのずれが生じるという点にある。

評価では、Llama系とQwen系の4つの公開モデルを使用した。推論エンジンにはvLLMを採用し、LMSYS-Chat-1Mから選んだ500件のプロンプトで検証している。

その結果、Qwen3-30B-A3Bでは、検知を回避しながら持ち出せる情報量を0.5%未満に抑えられたと報告している。研究チームは、攻撃に必要な時間が200倍以上に延びることに相当すると推定した。例えば、従来なら2日で完了する持ち出しに、1年以上かかる計算になる。

もっとも、この防御方法には前提条件がある。

論文では、サーバーや記憶装置を物理的に盗まれるケースは対象外としている。また、サイドチャネル攻撃が存在せず、検証サーバーも侵害されていないことが前提だ。さらに、モデル自身が本来の動作として重みを明かしてしまうような攻撃も防げないと、脚注で説明している。

4月の上院議員による書簡では、AIモデルやエージェント自身が重みの持ち出しを試みる場合についても質問していた。これは、今回の論文が防御対象としていない攻撃に近いと考えられる。

自社で追加学習したAIモデルにも、重みの保護は必要なのか

ここまで取り上げた議会の照会や研究の多くは、OpenAIやAnthropicのようなフロンティアAI企業、あるいは大規模な推論サービスを運営する事業者を主な対象としている。

推論検証の論文は推論サーバーを、CSAの研究ノートはAI開発企業のインフラを中心に扱っている。議会の照会先も、最先端のAIモデルを開発・運用する企業だ。

ただし、CSAは基盤モデルを運用、導入、統合する組織に対して、モデルの重みを自社の最も機密性の高いソースコードと同等に扱い、適切なアクセス制御を設けるよう求めている。一方、保管場所の棚卸しなどの具体的な推奨事項は、主にフロンティアAIモデルを開発、運用、統合する組織を念頭に置いたものだ。

では、一般企業にも同じ考え方を適用できるのだろうか。ここからは、公開資料をもとに、国内企業での利用を想定して考えてみる。

例えば、国内企業が公開モデルを自社データでファインチューニングし、社内サーバーで運用している場合だ。モデルを自社環境で動かす以上、その環境には重みのデータが保存されている。

機密データを外部に送らずにAIを利用するための導入であっても、今度はモデルの重み自体が、新たに保護すべき情報資産となる。

その重みには、ファインチューニングに費やした計算資源や調整作業の成果が反映されている。十分なGPU環境を持つ攻撃者なら、盗んだ重みを追加学習なしで動かせるというCSAの指摘は、モデルの規模が異なっても基本的には当てはまると考えられる。

もっとも、基盤となるモデルが一般公開されている場合、その部分は誰でも入手できる。流出によって新たに第三者の手に渡る価値は、主に企業が独自に追加した調整の成果にある。

一方、推論検証の論文が想定する攻撃シナリオを、そのまま一般企業に当てはめることはできない。

論文が対象としているのは、外部の利用者に大量の応答を返す推論事業者のサーバーだ。1日に数百GB規模の通信に情報を紛れ込ませることを想定している。

これに対し、社内だけで利用するAIモデルは、通信量も通信相手も異なると考えられる。ただし、社内利用だから安全という意味ではない。大量の外部通信に紛れ込ませる攻撃よりも、内部関係者による持ち出しや記憶装置の盗難など、別の経路を重視する必要があるだろう。

公開モデルに仕込まれたバックドアから、学習データが流出する可能性も

ファインチューニングを行う企業に特有のリスクを調べた研究もある。

ICLR 2026に採択された論文「Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen!」では、悪意あるバックドアを仕込んだ公開モデルを企業がファインチューニングした場合、元のモデルの作成者が追加学習に使われたデータを抽出できる可能性を示した。

攻撃者に必要なのは、ファインチューニング後のモデルへの「ブラックボックスアクセス」だけだ。これは、モデル内部の構造や重みを直接確認せず、入力と出力のやり取りだけを通じてアクセスすることを意味する。

実験では、5000件の問い合わせデータのうち、実用的な条件で最大76.3%を完全に抽出できた。さらに、攻撃者に有利な理想的条件では、抽出率が94.9%に達した。

重要なのは、これが重みの窃取とは別の攻撃だという点だ。

公開モデルに仕込まれたバックドアを悪用し、企業が独自に追加した学習データを取り出すものであり、重みが流出すれば必ず学習データも流出するという意味ではない。

まず必要なのは、重みの保管場所とアクセス権限の把握

CSAがAI開発企業向けに提案している対策のうち、一般企業でも比較的取り組みやすいのが、モデルの重みをどこに保存しているかを把握することだ。

CSAは、学習途中のチェックポイントや本番環境で使用する重みについて、保存先をすべて特定するよう求めている。対象にはメインのストレージだけでなく、バックアップや実験管理システムなども含まれる。

さらに、それぞれの保存先について、誰が、どのシステムを通じてファイルを読み取り、コピーし、移動できるのかを文書化し、アクセス履歴を記録することを推奨している。

この考え方は、自社でファインチューニングしたモデルを運用する企業にも応用できるだろう。

まずはモデルの重みが保存されている場所を洗い出し、それぞれのアクセス権限と操作履歴を確認できる状態にする。こうした基本的な管理体制の整備が、重みの流出を防ぐ第一歩になると考えられる。

議会の動きについては、4月の上院議員による書簡に各社がどう回答したのか、確認できる範囲では情報が見つからなかった。Khanna議員による今回の照会に、各社がどのような説明を行うかも現時点では不明だ。

技術面で今後注目されるのは、研究論文で提案された推論結果の検証方式が、実際のAIサービス運用に採用されるかどうかだ。

サイドチャネル攻撃が存在せず、検証サーバーも侵害されていないという前提のもとで、研究チームが示した「持ち出し時間が200倍以上になる」という結果が、実環境でも再現できるかが重要になる。

その効果が確認されれば、通常のAI応答に情報を紛れ込ませる手法による重みの窃取を、大幅に難しくできる可能性がある。ただし、物理的な持ち出しや内部関係者による不正アクセスなど、別の経路への対策も欠かせない。

AIモデルの重みは、開発企業にとって巨額の投資を凝縮した資産であり、自社で追加学習する企業にとっても、独自のノウハウが反映された重要な情報資産だ。AIの利用が広がるにつれ、顧客データや社内文書だけでなく、モデルそのものをどう保護するかが、企業のセキュリティ対策における重要な課題になっていく。