Anthropicは2026年9月29日、中国Z.aiの「GLM-5.3」が、脆弱性を悪用して一連の攻撃を成立させるコードを自律的に作成できるとする評価結果を公開した。特定の試験では、利用者を限定して提供されている「Claude Mythos Preview」に近い成績を示したという。
GLM-5.3は学習済みの重みが公開され、利用者が自分の環境で実行したり変更したりできるオープンウェイトモデルである。高度なサイバー攻撃能力にアクセスできる人の範囲が広がったことになる。
ただし、モデルそのものの攻撃能力を測った数字と、安全対策をどの程度回避できるかを測った数字では、試験条件が異なる。それぞれを分けて読む必要がある。
オープンウェイトモデルが限定提供モデルに迫った攻撃能力
Anthropicが今回重視したのは、ソフトウェアの不具合を見つけるだけでなく、その脆弱性を利用して実際に攻撃を成立させるところまで進められるかだった。
同社の評価では、Google Chromeなどで使われるJavaScriptエンジン「V8」の既知の脆弱性を対象にした「ExploitBench」で、GLM-5.3は410回の試行のうち50回、攻撃を最後まで成立させるエクスプロイトを作成した。
Claude Mythos Previewは、同じ410回の試行で56回成功した。
成功数を試行数で割ると、GLM-5.3は約12.2%、Mythos Previewは約13.7%となる。
ただし、対象となったのは41件の既知の脆弱性である。GLM-5.3が新たな脆弱性を50件発見したという意味ではない。
また、この能力比較に使われたClaudeは、サイバーセキュリティ向けの安全対策を無効にした状態で評価されている。一般利用者が通常のAPIを通じて使うClaudeの挙動と、そのまま同一視することはできない。
Anthropicは別の社内評価でも、GoogleのOSS-Fuzzに参加するオープンソースプロジェクトを対象に、脆弱性を発見したうえで「制御フローの乗っ取り」まで達成できるかを調べた。
制御フローの乗っ取りとは、プログラムが本来実行するはずだった処理の流れを、攻撃者が意図する方向へ変更することを指す。
無作為に選んだ100課題では、GLM-5.3が4%、Mythos Previewが6%の試行で制御フローの乗っ取りに成功した。一方、GLM-5.2とClaude Opus 4.6は、この試験では成功しなかった。
4%という数字だけを見ると低く感じられる。
それでも、前世代のモデルでは一度も到達できなかった段階にオープンウェイトモデルが到達したことには意味がある。単にソフトウェアをクラッシュさせることと、脆弱性を利用してプログラムの実行を制御することの間には、大きな技術的な隔たりがあるためだ。
ExploitBenchのプレプリントも、この違いを細かく評価するために作られている。
Seunghyun LeeとDavid Brumleyが2026年5月に公開したこのベンチマークでは、単なるクラッシュからメモリの読み書き、制御フローの乗っ取り、任意コード実行までを16段階の能力項目に分けて評価する。
「脆弱性を再現できる」ことと、「その脆弱性を利用して攻撃を成立させられる」ことを区別して測るのが狙いである。
12.2%、61.1%、54.4%は同じ数字ではない
米国立標準技術研究所(NIST)のAI標準・イノベーションセンター(CAISI)は9月17日、GLM-5.3について独自の能力評価を公開している。
CAISIはGLM-5.3を、これまでに公開されたオープンウェイトモデルの中で最もサイバー能力が高いモデルと評価した。一方、複数のサイバーセキュリティ評価をまとめた総合指標では、米国の最先端モデルより約4カ月遅れているとしている。
ここでいう「4カ月」は、課題の難しさを考慮した複数のベンチマークから算出した能力指数上の差である。
「4カ月後には必ず米国モデルへ追いつく」という将来予測ではない。
また、CAISIのいう「米国最先端」は、同機関が評価した公開済みの米国製モデルの中で最も高い能力水準を指し、利用者を審査して限定的に提供されているモデルも含まれる。
そのため、Anthropicが特定のExploitBench試験でGLM-5.3がMythos Previewに近いとした結果と、CAISIの「約4カ月の差」は矛盾しない。測っている範囲と比較対象が異なるためだ。
さらに注意が必要なのは、同じ「ExploitBench」という名前の評価でも、公表されている数字をそのまま比較できないことである。
Anthropicの約12.2%、CAISIの61.1%、Z.aiの54.4%は、それぞれ採点方法が違う。
公開資料に記載された評価方法を整理すると、次のようになる。
| 評価主体・資料 | GLM-5.3の値 | 測っているもの | 試行結果のまとめ方 |
|---|---|---|---|
| Anthropic、9月29日 | 約12.2% | 攻撃を最後まで成立させた試行の割合 | 50成功÷410試行×100 |
| CAISI、9月17日 | 61.1% | 16項目で評価した能力スコア。平均9.8点 | 41課題について各3回試し、課題ごとに最高得点を採用 |
| Z.ai公式モデルカード | 54.4% | 到達できた能力項目の平均割合 | 各課題を3回試し、到達した能力項目の和集合を集計 |
CAISIとZ.aiのスコアでは、最終的に攻撃を完成させられなかった場合でも、途中まで到達した能力が点数に反映される。
さらにCAISIは各課題で最も高い得点を出した試行を採用するのに対し、Z.aiは複数回の試行で到達した項目を組み合わせて評価する。
実行環境や評価時期も完全にはそろっていない。このため、12.2%、61.1%、54.4%という数字から単純に倍率を計算したり、モデルの優劣を順位付けしたりすることはできない。
一方、CAISIの個別ベンチマーク表で示される「米国最先端」は、それぞれの評価で最高得点を記録した米国モデルを指す。ExploitBenchでは100%となっている。
GLM-5.3の61.1%には45.9〜74.5%の95%信頼区間も示されている。
CAISIは最大の推論設定を使用し、適用可能な米国モデルについてはサイバーセキュリティ向けの安全対策を無効にして評価した。
したがって、誰でも取得できるオープンウェイトモデルの能力が大きく向上したことと、現時点で最も高い能力を持つモデルとの間に差が残っていることは両立する。
20.40ドルで示された「修正公開から攻撃コードまで」の短縮
Anthropicは自動ベンチマークだけでなく、研究者がGLM-5.3を実際に使う試験も行った。
ある試験では、隔離されたLinux環境上のブラウザを対象にGLM-5.3を使ったところ、モデルがJavaScriptエンジンに存在する複数の未知の脆弱性を発見し、それらを組み合わせて攻撃を成立させたという。
作成されたWebページをブラウザで開くと、端末内の任意のファイルを読み取れる状態になった。Anthropicは、発見した脆弱性についてソフトウェアの保守担当者へ通知したとしている。
ただし、対象となったブラウザ名は公表されていない。
また、実証したのはモデルに与えられたLinux環境である。他のOSでも影響する可能性をAnthropicは指摘しているが、同じ攻撃がそのまま成立すると確認したわけではない。
別の試験では、小型版の「GLM-5.3-Flash」が使われた。
研究者がGoogle Chromeの既知の脆弱性CVE-2026-11645と、別の既知の脆弱性について公開情報を与えたところ、モデルは二つの脆弱性を組み合わせ、ARM64環境を対象とした一連の攻撃を作成した。
さらに、ポインタが不正に変更されていないかを検証する保護機構「Pointer Authentication(PAC)」も回避したとAnthropicは報告している。
この作業に人間が直接費やした時間は20分、GLM-5.3-Flashが処理した時間は8時間だった。
Anthropicは、当時のZhipuのAPI価格で計算すると20.40ドル相当になるとしている。
これは実際に支払われた総費用ではない。研究者の人件費や実験環境の費用も含まず、「どのような攻撃でも20.40ドルで作れる」という意味でもない。
それでも、防御側にとって重要な点がある。
ソフトウェア企業が脆弱性を修正すると、修正内容の公開によって、その脆弱性の存在や修正方法についての情報も外部から分析できるようになる。
AIによって、そうした公開情報から実際に動作する攻撃コードを作るまでの手間が大幅に減るのであれば、修正版が公開されてから利用者がアップデートを適用するまでの時間が、これまで以上に重要になる。
今回の実験から読み取れるのは、そうした防御上のリスクである。実際の利用者がこの攻撃によって被害を受けたと報告されたわけではない。
未知の脆弱性を発見する能力だけでなく、すでに公表された脆弱性を実用的な攻撃へ変換する能力も、ソフトウェア更新の優先度を考えるうえで重要になっている。
64〜100%は「攻撃成功率」ではない
GLM-5.3には、有害な依頼を拒否するための安全対策が組み込まれている。
Anthropicの模擬試験でも、明確な攻撃依頼をそのまま与えた場合、GLM-5.3はすべての試行で拒否した。
しかし、依頼の与え方を変えたり、公開されているモデルの重みそのものを変更したりすると、挙動は大きく変化した。
| Anthropicの模擬試験の条件 | GLM-5.3が攻撃対象への接続を試みた割合 |
|---|---|
| 有害な依頼をそのまま提示 | 0% |
| 正当なセキュリティ演習だと偽って依頼 | 64% |
| 実行する方向へ進んだように推論部分を事前入力 | 92% |
| 拒否を弱めるようモデルの重みを変更 | 100% |
各条件では、5種類の攻撃依頼と2種類の模擬対象を組み合わせ、それぞれ5回ずつ試した計50サンプルが使われた。
ここで特に重要なのは、64%、92%、100%が「攻撃を成功させた割合」ではないことである。
測定したのは、有害な依頼を受けたモデルが模擬された攻撃対象への接続を試みる行動に進んだ割合だ。
Anthropicの脚注によれば、この試験ではモデルが生成したコードを実際には実行しておらず、外部システムへ接続することもできない。
モデルには架空のbashツールが与えられ、別の言語モデルがコマンドの実行結果を模擬している。
したがって、「安全策を回避すると100%の確率で実際のサイバー攻撃に成功する」という結果ではない。
安全対策を有効にしたClaudeは、適用可能だった条件ではこうした操作を開始しなかった。
ただし、単純な比較には注意が必要だ。
推論内容の事前入力は通常のClaude APIではできず、Claudeのモデル重みも利用者には公開されていないため、GLM-5.3に対して行った重みの変更そのものを実施できない。
つまり、ここで測られている差には、モデルが有害な依頼を拒否するよう学習されている効果だけでなく、API利用者にどこまでモデル内部を操作させるかという提供方式の違いも含まれている。
さらに、先のサイバー攻撃能力そのものを測る比較ではClaudeの安全対策を無効にしているのに対し、この安全性評価ではClaudeの安全対策を有効にしている。二つの試験は目的が異なる。
モデルの重みを変更すると拒否率は大幅に低下
Anthropicは、GLM-5.3の拒否動作を弱めるため、「abliteration」と呼ばれる手法を使ってモデルの重みを変更する試験も行った。
同社によると、探索や変更後の検証を含めて約2,200 GPU時間を使用し、計算費用は約4,400ドルだった。
ただし、その大部分は複数の方法を並行して試し、変更後のモデル性能を評価するために使われたという。
Anthropicは、この手法に慣れたチームであれば、GLM-5.3について約600 GPU時間、計算費用約1,200ドルで同様の変更が可能だと推定している。
後者は実測結果ではなく、Anthropicによる見積もりである。
変更後のGLM-5.3は、有害な依頼への拒否率がもともとの90%以上から大幅に低下した。
JailbreakBenchでは約3%、HarmBenchでは約2%、StrongREJECTでは12%となった。
一方、科学分野の知識を測るGPQA-Diamondでは変更前と変更後で同じ成績を示し、CyberGymの一部課題では数%の低下にとどまったとAnthropicは報告している。
つまり、安全上の拒否動作を大幅に減らしたからといって、モデルの一般的な能力がすべて失われたわけではない。
ただし、限られたベンチマークで性能が維持されたことを、あらゆる用途で元の性能が維持される証拠とみなすことはできない。
また、これらの安全対策に関する試験は、GLM-5.3と競合するモデルを開発するAnthropic自身が実施したものである。
CAISIによる独立評価はGLM-5.3の高いサイバー能力については裏付けているが、Anthropicが示した64〜100%という安全対策回避の結果を独立に再現したものではない。
オープンウェイトの強みは防御側にも使える
Z.aiは8月14日の発表で、GLM-5.3はGLM-5.2と同じ基盤モデルを使い、事後学習によって能力を伸ばしたと説明している。
長時間にわたって複数段階の作業を行うための学習環境を拡充し、サイバーセキュリティ分野の課題についても能力を高めたという。
Z.ai自身の説明では、GLM-5.3はコードを理解して脆弱性を探すだけでなく、複数段階の作業を続けて実行する能力を強化している。
同社は安全性評価と対策を行ったうえで、モデル発表から2週間後に重みを公開する方針も示した。
NISTも、実際に発表から2週間後にモデルの重みが公開されたと記している。現在は公式のモデルリポジトリから取得できる。
したがって、今回の問題は「Z.aiが安全対策をまったく用意しなかった」という単純な話ではない。
より重要なのは、モデルの重みが利用者に公開された後、その重みを変更できる環境でも、有害な利用を拒否する仕組みをどこまで維持できるかという点にある。
一方、同じオープンウェイトという性質は、防御側にも利点をもたらす。
企業や研究者がモデルを自分たちの環境で動かし、自社ソフトウェアの脆弱性を探したり、モデルの挙動を詳しく検証したりできるためだ。
Anthropicも、防御担当者は自らの目的に合う最も優れたツールを利用できるべきだとして、Claudeの高度なサイバーセキュリティ能力を防御側へ広く提供する必要性を訴えている。
同社はProject Glasswingなどを通じて、審査を通過した防御担当者への提供を進めている。ただし、高度な能力を誰でも同じ条件で利用できるわけではない。
ここには、API型モデルとオープンウェイトモデルの大きな違いがある。
APIでは、提供企業が利用者に許可する操作やモデルの挙動をある程度制御できる。一方、モデルの重みそのものを取得できる場合、利用者は自分の計算環境で動かし、場合によってはモデルの挙動そのものを変更できる。
そのため、サイバーセキュリティ用途でAIを導入する際には、モデル名や総合ベンチマークの数字だけを見るのでは十分ではない。
自社のソフトウェアを対象に脆弱性の発見や修正をどこまで再現できるのか、モデルに与える権限を制限できるのか、そしてAIが出した結果を人間が検証できる体制を用意できるのかを確認する必要がある。
高度なサイバー能力を持つオープンウェイトモデルが広く利用可能になれば、攻撃側が脆弱性を実用的な攻撃へ変えるまでの時間が短くなる可能性がある。
同時に、防御側もその能力を脆弱性の発見や修正へ利用できる。
今後問われるのは、高性能なモデルへのアクセスを単純に制限するかどうかだけではない。攻撃に使える能力が広がる中で、防御側が同じ能力をどれだけ早く脆弱性の発見と修正へ生かせるかである。
