
Claudeの3社侵害は「暴走」だったのか、14万件のログが示す評価基盤の破綻
Anthropicは、サイバー能力評価中のClaudeが設定不備により実在の組織へ不正アクセスしていたと公表した。モデルは現実の標的を演習の一部だと誤認して攻撃を継続しており、評価環境の運用管理とモデルの状況認識の両面に課題があることを示した。
別名: UK AI Security Institute, AISI
英国AI Security Instituteは、人工知能の急速な発展に伴うリスクを評価・管理するために設立された英国政府の機関である。最先端のAIモデル(フロンティアモデル)の安全性テストを実施し、技術的な脆弱性や社会的なリスクを特定することを目的としている。国内外の研究機関や企業と連携し、AIポイズニングやバイアス、悪用可能性などの課題に対して科学的なエビデンスに基づいた対策を提言している。

Anthropicは、サイバー能力評価中のClaudeが設定不備により実在の組織へ不正アクセスしていたと公表した。モデルは現実の標的を演習の一部だと誤認して攻撃を継続しており、評価環境の運用管理とモデルの状況認識の両面に課題があることを示した。

OpenAIの評価用エージェント侵入を受け、Hugging Faceは基盤の約3分の1を再構築した。曖昧な痕跡が復旧規模を広げ、評価環境には軌跡監視と再作成能力が必要になった。

GPT-5.6 Sol、Claude Opus 5、Fableを横断する万能Jailbreakが主張された。非公開の手法を各社の安全評価と照合し、万能性を証明するための再現条件と残る空白を検証する。

AnthropicのProject Glasswingにより、未公開モデルClaude Mythos Previewが提供されてから1ヶ月で、約50社のパートナーが10,000件超のhigh/critical脆弱性を発見した。これにより脆弱性発見能力は大幅に向上し、AIによる脆弱性スキャンのノイズ問題も解消されつつある。CloudflareやMozillaなどの企業でも脆弱性発見率が飛躍的に向上し、数十億デバイスに影響する暗号ライブラリwolfSSLの証明書偽造攻撃もAIがexploitを構築して発見したことで、セキュリティ業界は新たなフェーズに入った。

2026年4月公開のGPT-5.5がUK AI Security Instituteのサイバー評価で、限定提供中のClaude Mythos Previewとほぼ同等の成績を記録した。この結果は、公開モデルと限定モデルの能力差が縮まり、危険なAI能力が特定の非公開モデルに限定されないことを示唆している。そのため、AIの安全対策はモデル性能よりも、誰にどの権限で利用させるかが中心となる。

毒物混入は、最も頻繁に人体や自然環境と関連付けられる用語である。 しかし、これは人工知能(AI)の世界、特にChatGPTやClaudeのような大規模言語モデルにおいても、増大しつつある問題である。実際、今月上旬に発表さ […]