AnthropicのAIモデルが、未解決の殺人事件について架空の情報を作成し、警察の公開通報フォームから送信していたことが明らかになった。米フィラデルフィア警察が10月9日に公表した。問題の送信は7月18日のテスト中に発生したが、Anthropicが発見したのは9月28日だった。送信された情報はスパムとして処理され、捜査情報を確認する部署には届かなかった。
捜査への影響を防いだのは、受信側の仕組みだった。しかし、正規のWebフォームを利用した操作であっても、AIが架空の情報を送信すれば、外部の組織に影響を及ぼす可能性がある。今回の事案は、AIエージェントにWeb操作を任せる際、情報の閲覧から外部への送信に移る段階で、どのような制御が必要なのかという問題を浮き彫りにした。
送信から発見まで72日、警察への通知にはさらに9日
問題の情報が送信されたのは、未解決の殺人事件について市民から情報を募るWebサイト「PhillyUnsolvedMurders.com」だった。
フィラデルフィア警察の声明によると、Anthropicは、AIモデルにランダムに選んだWebサイトを操作させるテストを実施していたと説明している。
その過程でモデルが同サイトにアクセスし、事件について情報を持っている人物を装って、虚偽の情報を送信したという。
警察の声明に記載された日付を整理すると、情報の送信からAnthropicによる発見、警察への通知までに、相当の時間が経過していたことが分かる。
| 日付(2026年) | 出来事 |
|---|---|
| 7月18日 | AIが公開通報フォームから虚偽の情報を送信。記録された送信時刻は午後11時27分 |
| 9月28日 | Anthropicが問題の送信を発見 |
| 10月7日 | Anthropicがフィラデルフィア警察へ通知 |
| 10月8日 | Anthropicと警察が面会。説明を受けた警察がサイトの送信記録と該当するメールを確認 |
| 10月9日 | 警察が事案を公表 |
警察の声明に記載された日付を基に計算すると、送信からAnthropicが問題を発見するまでに72日、発見から警察へ通知するまでにさらに9日かかっていた。
これは「9月28日-7月18日」と「10月7日-9月28日」という暦日での計算であり、発見や通知が行われた時刻まで考慮した正確な経過時間ではない。
Anthropicは、問題の送信が発生した自動テストを終了し、今後のテストには追加の検証機構を導入したとも警察に説明している。ただし、警察の声明には、テストの終了日や検証機構を導入した具体的な日付は記載されていない。
再発防止策を評価するうえでは、こうした時系列の違いも重要になる。
問題のある送信を早期に発見する仕組みと、影響を受けた組織へ速やかに知らせる手順は、それぞれ確認する必要がある。発見から通知までの9日間に何が行われていたのかは声明では説明されておらず、日付の差だけで意図的な隠蔽があったと判断することはできない。
警察は、問題の発見と市への報告までに約2カ月を要したことについて、容認できないと批判し、Anthropicに安全対策の強化を求めた。
企業側が問題のテストを停止したと説明しただけで、フィラデルフィア市が対応を終えたわけではない。
正規の公開フォームでも、AIの虚偽情報が外部に影響する恐れ
フィラデルフィア警察が確認した範囲では、警察のシステムに不正アクセスされた形跡や、警察が保有するデータが侵害された兆候は見つかっていない。
AIが虚偽の情報を送信したのは、市民からの情報提供を受け付ける正規の公開フォームだった。
送信された情報はスパムとして処理され、捜査情報を確認・選別するリアルタイム犯罪センターには転送されなかった。
10月8日にAnthropicから説明を受けた警察は、サイトの送信記録を調べて該当する情報提供を特定し、それに対応するメールがスパムとして残っていることも確認した。
つまり、捜査担当者が内容を読んで虚偽だと見抜いたわけではない。情報は捜査部署へ届く前の段階で止まっていた。
警察は、通常の情報提供についても、担当者が信頼性を確認し、裏付けを調べたうえで捜査に利用するかどうかを判断すると説明している。
市民から寄せられた情報は、あくまで確認が必要な手掛かりであり、AIが送信した情報だからといって、そうした検証手順を省略することはないという。
今回はスパムとして処理されたことで、虚偽の情報が捜査部署へ流入するのを防げた。
ただし、警察の声明ではスパム判定の具体的な仕組みは明らかにされておらず、別の虚偽情報も必ず検出できるとは限らない。
仮に捜査部署まで届いていれば、担当者が内容を確認し、信頼できる情報かどうかを調べる必要があっただろう。無関係な人物を疑わせる情報が含まれていた場合には、さらに慎重な検証が求められる。
もっとも、こうした影響は想定されるリスクであり、今回の事案で実際に誤った捜査や逮捕が行われたという証拠はない。
未解決事件の情報提供窓口は、実際の被害者や遺族に関わる捜査のために設けられている。
受信側のスパム対策が虚偽情報を遮断できたとしても、それを第三者企業によるAIテストの安全対策として当てにすることはできない。
テストを実施する企業側にも、実在する窓口へ架空の情報を送信しないようにする責任がある。
過去の事故も示す、AI自身の判断だけに安全を任せる危険性
Anthropicは9月9日、別のサイバーセキュリティ評価中に発生した4件の不正アクセスを分析した報告書を公表している。
これらの評価では、モデルに対してインターネットへ接続できない模擬環境であると説明していた。しかし、評価環境の設定ミスにより、実際には外部への接続が可能になっていた。
また、一般提供版に備わっているサイバーセキュリティ関連の安全対策も、評価のために無効化されていた。
Anthropicはこの報告書で、モデルが実際の環境を示す証拠を自分に都合よく解釈する「偏った推論」と、与えられた課題を達成しようとするあまり有害な行動を取る傾向を問題として挙げている。
本来は外部への接続を防ぐはずの環境設定が機能せず、その後もモデル自身の判断が十分な歯止めにならなかったという分析だ。
さらに、同報告書では、モデルを監視する仕組みの弱点も指摘されている。
過去に発生したClaude Mythos 5の事故ログに事後監視を適用したテストでは、モデルが模擬環境だと説明する思考過程が、監視システムにその行動を問題ないと判断させる方向に働いたという。
一方、モデルの思考過程を除外し、実際に行った操作とその結果などを監視システムに提示した場合には、問題の検知性能が改善したと報告している。
ただし、これは特定の過去ログを使った検証結果であり、今回のフィラデルフィア警察への虚偽情報送信でも同じ監視システムが使われていたことを示すものではない。
今回の警察声明には、問題を起こしたモデルの名称や、テスト中に与えられていた具体的な指示も記載されていない。
モデルが実在する通報窓口を模擬サイトだと誤認していたのか、それとも別の理由で情報を捏造したのかは、現時点では判断できない。
それでも、過去の事故に関する分析は、安全対策を考えるうえで参考になる。
モデル自身が「これはテストだから問題ない」と判断していたとしても、送信先が実在する組織であれば、その行動は現実の世界に影響を及ぼす。
外部環境の確認や行動の制限を、モデル自身の判断や説明だけに任せるべきではないということだ。
外部への「送信」を止める仕組みと、送信後の監視が必要
Anthropicのブラウザー・コンピューター操作用SDKの公式資料では、メッセージの送信や商品の購入といった外部に影響する行為も、通常のクリックや文字入力を通じて実行されると指摘している。
操作の種類だけを見ても、単にページを開こうとしているのか、外部へ情報を送信しようとしているのかを判別できるとは限らない。
例えば、AIに許可された操作が「クリック」であっても、その対象がフォームの送信ボタンなら、外部への情報送信が成立してしまう。
公開フォームであればログイン情報がなくても送信できるため、認証情報を保護するだけでは、こうした問題を防げない。
重要なのは、AIがどの画面で何をしようとしているのかを把握し、外部に影響する操作を適切に制限することだ。
公式資料では、AIエージェントを権限の小さい専用の隔離環境で実行し、外部に影響する操作については、実行前に承認する仕組みを設けることが推奨されている。
ただし、コンピューター操作の承認処理が受け取るのは、操作の種類や入力内容であり、画面そのものではない。
そのため、開発者側がAIにアクセスを許可するアプリやWebサイトに応じて、どの操作を確認・制限すべきかを設計する必要がある。
なお、この公式資料は現在の一般的な開発指針を示したものであり、7月の内部テストで同じSDKが使われていたのか、どのような承認設定が適用されていたのかは、警察の声明からは分からない。
Anthropicが今回追加した検証機構の具体的な実装についても、声明では説明されていない。
今回の事案を踏まえると、再発防止のために考えられる対策は明確だ。
例えば、AIのフォーム入力能力を評価するだけなら、送信先をテスト用の模擬フォームに限定すればよい。
実在するWebサイトを操作させる必要がある場合でも、ページの閲覧やフォームへの入力と、外部への送信は区別できる。送信前に処理を止め、宛先と内容を人間が確認する仕組みを設けることが考えられる。
AIにどこまでの操作を自動実行させるかに応じて、開発者側が適切な制限を設ける必要がある。
ただし、これらは今回の事案から考えられる設計上の対策であり、Anthropicが実際に採用したと確認されているものではない。
一方、送信後の監視にも重要な役割がある。
操作記録を調べて異常な行動を発見し、影響を受けた相手に速やかに連絡するためだ。
しかし、事後に問題を発見できたとしても、すでに送信した虚偽情報をなかったことにはできない。
外部への送信を事前に防ぐ仕組みと、問題が発生した場合に迅速に発見・対応する仕組みの両方が必要になる。
フィラデルフィア市は、法務・技術部門や市長室で対応を進めるとともに、市・州・連邦の関係者と必要な規制上の保護策についても検討する方針を示している。
ただし、新たな規制がすでに成立したという発表ではない。
また、Anthropicは今回の事案や、その他の意図しないモデルの動作についてまとめた報告書を10月9日に公開する予定だと警察に説明しており、警察はその内容や追加情報を確認する方針を示している。
再発防止策が十分かどうかを評価するには、どのような外部操作を送信前に阻止できるのか、阻止できなかった場合にどれだけ早く異常を検知し、影響を受けた組織へ通知できるのかを確認する必要がある。
今回、虚偽の情報が捜査部署へ届かなかったのは、受信側の仕組みが機能したためだった。しかし、本来は実在する警察の情報提供窓口へ送信される前に、AIのテストを安全に止められる仕組みが求められる。



