Anthropicは2026年10月8日、オープンソースソフトウェア(OSS)の脆弱性を無料で定期的に調査する新サービス「OSS Scanner」を発表した。Claude Mythosを含む同社の高性能AIモデルを使って脆弱性を探し、参加を希望するプロジェクトの保守担当者へ結果を報告する。最大の特徴は、人間による事前検証を待たずに、問題の再現手順や修正パッチ案を届ける点だ。AIによる脆弱性の発見速度が高まる一方、人間による検証や修正が追いつかないという課題に対し、対応能力のあるプロジェクトが早期に調査を始められる仕組みを提供する。
6カ月で29,000件以上を発見、人間が検証できたのは約6,000件
Anthropicによると、過去6カ月間の監査で29,000件以上の脆弱性候補を発見したが、人間が内容を確認し、対応の優先順位を付けられたのは約6,000件にとどまった。未検証の候補がすべて本物の脆弱性というわけではないものの、AIの発見速度に人間の検証が追いついていないことは明らかだ。
公式発表によると、当初の報告を受け取った保守担当者からは、未検証の候補も含めて送ってほしいという要望が増えていた。Anthropicはこうした要望に応じ、すでに5,000件近くの報告を提供してきたという。
OSS Scannerは、この取り組みを継続的なサービスとして提供するものだ。報告には問題を再現するためのテストケースや説明が含まれ、可能な場合は修正パッチ案も添付される。問題がどの変更によって混入したのか、変更履歴を絞り込んで調べた結果が付くこともある。公式FAQによると、監査には発見した問題を再確認するエージェントや、根本原因を調査するエージェントも使用される。
ただし、未検証の報告を大量に送ることにはリスクもある。
curlの開発者Daniel Stenberg氏は、2025年7月のブログ記事で、AIが生成した低品質な脆弱性報告への対応が、保守担当者の大きな負担になっていると説明した。1件の確認に3〜4人が関わり、それぞれ30分、場合によっては数時間を費やすという。OSSの保守に充てられる時間が限られる開発者にとって、誤った報告の増加は深刻な問題だ。
一方、今回のAnthropicの発表に掲載されたStenberg氏のコメントでは、OSS Scannerがcurlで修正する価値のある問題を複数発見したことを評価している。
2025年に問題となった報告と今回のOSS Scannerでは対象が異なるため、精度を直接比較することはできない。それでも、保守担当者にとって重要なのは、AIが作成した報告かどうかではなく、問題を再現でき、実際の修正につなげられるかどうかだ。
報告の90%以上が正しい? 初期検証で分かった精度と課題
AnthropicはCyber Missionの発表で、OSS Scannerの真陽性率、つまり報告が実在する問題を正しく指摘している割合について、90%を超えると見込んでいる。ただし、これは同社の見通しであり、サービス全体の実測値や精度保証ではない。
参考になるのが、別途公表された初期版の検証結果だ。
Anthropicは、48のプロジェクトで見つかった深刻度「Critical」「High」の脆弱性報告97件を、通常の協調的脆弱性開示(CVD)でも検証を担当する侵入テストの専門家に確認してもらった。
その結果、85件がCVDの基準を満たした。残る12件のうち11件は実在する問題だったものの、既知の問題や別の報告と重複しており、誤検知は1件だった。
| 初期検証での分類 | 件数 | 全体に占める割合 |
|---|---|---|
| CVDの基準を満たした報告 | 85件 | 87.6% |
| 実在するが、既知の問題や別の報告と重複 | 11件 | 11.3% |
| 誤検知 | 1件 | 1.0% |
| 合計 | 97件 | 100% |
出典:Anthropicの2026年10月8日の発表。割合は97件を分母に算出し、小数第1位に丸めた。個別の割合は丸めのため合計が100%と一致しない。
重複を含めれば、実在する問題を指摘していた割合は99.0%に達する。一方、新たな報告としてCVDの基準を満たした割合は87.6%だった。Anthropicが示す88%は、後者を整数に丸めた値である。
問題が実在することと、新たな脆弱性報告として修正につながることは別だ。 既知の問題や重複した報告であっても、保守担当者には照合作業が発生する。
また、検証対象は初期版の重大・高深刻度の97件に限られている。すべてのプロジェクトや深刻度で同じ結果が得られるか、実在する脆弱性をどれだけ見落としているかは分からない。専門家による検証結果ではあるものの、Anthropicが公表したものであり、サービス全体を対象とした独立評価とも異なる。
同社は、保守担当者から深刻度の過大評価や脅威モデルの誤解を指摘されたことも明らかにしている。脆弱性が実在していても、実際の運用環境でどれほど危険なのかは、プロジェクト固有の条件を踏まえて判断する必要がある。
登録にはDockerfileが必要、脅威モデルの提供も推奨
OSS Scannerの対象は、インフラや利用者の安全に大きな影響を与える重要なOSSだ。外部から攻撃される可能性や、依存する利用者・プロジェクトの規模などを考慮し、Anthropicが個別に参加の可否を判断する。
利用を希望する場合、主要な保守担当者が登録用GitHubリポジトリへ設定ファイルを追加し、プルリクエストを提出する。Anthropicは申請者の保守権限も確認するため、すべての公開リポジトリが自動的に監査対象になるわけではない。
登録には、監査対象のGitリポジトリ、連絡先メールアドレス、実行環境を構築するためのDockerfileが必要だ。
依存関係の取得やビルドはネットワークに接続できる環境で行い、その後の脆弱性調査はインターネットへの接続を遮断した隔離環境で実行する。そのため、必要な依存関係を初期構築時にそろえ、完成した環境でテストが動作することを確認しておく必要がある。
報告はメールで届く。登録用の設定ファイルに記載するメールアドレスは公開されるため、公式の手順では公開しても問題のないセキュリティ窓口などを使うよう案内している。OpenPGP公開鍵を登録すれば報告を暗号化できるが、その場合は追加のCC宛先を指定できない。なお、登録情報がGitHubで公開されても、脆弱性報告そのものが公開されるわけではない。
監査の精度を高めるため、Anthropicが強く推奨しているのが、任意で提出できる「脅威モデル」だ。
脅威モデルには、想定する攻撃、信頼できない入力の経路、重点的に調べる機能、検査対象から除外する範囲などを記載できる。さらに、脆弱性の深刻度を判断する基準や、報告形式、修正案の詳しさ、重複報告の扱いについても希望を伝えられる。
例えば、認証済みユーザーだけが悪用できる問題や、実際の悪用が確認されていないバッファオーバーフローを、どの程度の深刻度とするかはプロジェクトによって異なる。こうした前提を伝えなければ、AIは不明確な条件を推測して判断することになり、過剰な警告につながる可能性がある。
OSS Scannerは、GoogleのOSS-Fuzzから着想を得ている。OSS-Fuzzがさまざまな入力を与えてソフトウェアを実行し、クラッシュや異常な動作を探すファジングを大規模に行うのに対し、OSS Scannerは言語モデルを使ってコードを調査し、再現手順や修正案まで報告する。
手法が異なるため、既存のファジングと組み合わせて検査範囲を広げられる可能性がある。ただし、今回の発表でOSS-Fuzzより優れていることや、従来の検査を置き換えられることが実証されたわけではない。
人間が未検証の報告には、90日間の公開期限を適用しない
OSS Scannerの脆弱性開示方針では、人間による検証が済んでいない報告に対して、90日間の協調的脆弱性開示期限を適用しないと明記している。
Anthropic自身が確認していない問題について、保守担当者に期限内の検証を義務付けないためだ。こうした未検証の報告をAnthropicが公開することもない。
ただし、その後に通常のCVD手続きで人間が脆弱性を確認した場合は扱いが変わる。検証が完了したことを保守担当者へ通知した日を起点に、通常のCVD方針に従って情報を開示する可能性がある。
Anthropicの通常のCVD方針では、原則として90日間の経過、またはパッチ公開のいずれか早い時点を目安に情報を開示する。期限の延長や、すでに悪用されている脆弱性について開示を早める例外もある。また、完全な技術的詳細の公表については、原則としてパッチ提供後も45日間待ち、利用者が修正を適用する時間を確保する。
つまり、未検証の報告が届いた時点で、自動的に90日間の期限が始まるわけではない。
Anthropicは将来、OSS Scannerによる一部の重大な報告にも開示期限を設ける可能性を示している。その場合は事前に通知し、参加を取りやめる選択肢を提供するという。
現在も設定変更によって報告を一時停止でき、登録を削除すればサービスから離脱できる。離脱後は、従来どおり人間による検証が完了したCVD報告のみを受け取る方式に戻る。
無料の監査を、実際の脆弱性修正につなげられるか
AnthropicはOSS Scannerを、すでに検証済みの重大・高深刻度の脆弱性報告に対応できており、さらに安全性を高めたいプロジェクト向けのサービスと位置付けている。対応する人員や時間が不足しているプロジェクトには、引き続き人間が検証した報告を提供する方針だ。
企業向けの商用サービス「Claude Security」と異なり、OSS Scannerでは監査費用をAnthropicが全額負担する。より多くの計算資源を使う実験的な監査手法も投入するとしており、小規模な保守チームでも、自前では確保しにくい計算資源を利用できる。
一方、修正パッチ案が届いても、内容が正しいか、既存の機能に悪影響を及ぼさないかを確認する必要がある。どのバージョンへ修正を適用し、利用者へどう提供するかという判断も保守担当者に残される。
継続的な監査では、新たに混入した脆弱性だけでなく、過去の監査で見落とされた問題も調査する。ただし、実行頻度は参加プロジェクト数や利用規模などによって変わり、毎日、あるいはコードの変更ごとに必ず検査されるわけではない。既存のテストやセキュリティ検査を継続しながら、追加の報告に対応できる体制を整える必要がある。
今後、OSS Scannerの実用性を評価するうえで重要なのは、脆弱性の発見件数だけではない。重複報告がどれほど含まれるのか、保守担当者が検証に何時間を費やすのか、報告から修正完了までに何日かかるのかが、より重要な判断材料になる。
AIが大量の脆弱性を発見できるようになった今、課題はその情報を人間が無理なく検証し、修正につなげられるかどうかに移っている。OSS Scannerが実際の安全性向上に貢献できるかは、発見能力の高さだけでなく、保守担当者の負担を抑えながら修正を進められるかにかかっている。



