
Anthropic最強AIはなぜ封印されたのか? Fable停止を招いたAmazon研究とホワイトハウスの内幕
米政府は、Anthropicの最新AIモデルがサイバー攻撃に悪用される懸念があるとして、外国籍者への提供停止を命じた。同社は選別的な遮断は困難だとして全ユーザー向けに公開を停止したが、政府の判断は技術的評価を超え、国家安全保障上の問題に発展した。
別名: Jailbreak, 脱獄, jailbreak
ジェイルブレイクとは、大規模言語モデル(LLM)などのAIシステムに組み込まれた安全性ガードレールを回避し、開発者が意図的に制限した有害・危険な出力を強制的に引き出す手法の総称である。プロンプトの文言を巧妙に操作したり、対話の文脈を偽装したりすることで、モデルに本来拒否すべき指示を実行させる点が特徴である。生成AIの実用化が進むにつれ、サイバー攻撃支援や偽情報生成など悪用リスクが高まっており、AI開発企業や各国当局にとって重要な安全対策上の課題となっている。
ジェイルブレイクの手法は、単純な指示の言い換えから、多段階の対話を通じてモデルの防御を段階的に崩す高度な技法まで多岐にわたる。攻撃者はモデルに架空の役割を演じさせたり、無害な文脈に危険な要求を埋め込んだりすることで、安全フィルターの判定基準をすり抜けようとする。これに対し開発企業側は、強化学習による安全微調整やコンテンツフィルタリング、システムプロンプトの階層化など複数の防御層を組み合わせて対抗している。
ジェイルブレイクは、外部から悪意あるコンテンツをモデルに注入する「プロンプトインジェクション」と近縁の概念だが、前者はモデル自身の安全ポリシーを無効化する点に主眼が置かれる。近年は、モデルの性能向上と並行して、誰にどの権限で機能を利用させるかというアクセス制御の設計が安全対策の中心課題として位置づけられるようになっている。この傾向は、能力の高いモデルほど誤用時の被害が大きくなるため、単なる出力フィルタリングだけでは不十分であるという認識の広がりを反映している。
2026年6月には、Anthropicの最新モデルがサイバー攻撃への悪用懸念から米政府によって外国籍者への提供を停止される事態が生じ、ジェイルブレイクを含む悪用リスクへの対応が、企業の技術的判断を超えて国家安全保障上の問題として扱われる転換点となった。同時期には、2026年4月に公開されたGPT-5.5が英AI Security Instituteのサイバー評価で限定提供中のClaude Mythos Previewとほぼ同等の成績を記録したことが報告され、公開モデルと非公開モデルの能力差が縮小している実態が示された。この結果は、危険な能力が特定モデルに限定されなくなっている以上、安全対策の焦点をモデル性能そのものよりも利用権限の管理に移す必要があることを示唆している。
また2026年4月には、OpenAIが指示の階層化によってプロンプトインジェクションへの耐性を高める取り組み「IH-Challenge」を発表するとともに、レッドチーミングツールを開発するPromptfooを買収し、エンタープライズ向けAIの安全性とガバナンス強化を進めた。同月には、欠陥のあるコードを学習したAIが不整合な主張を示す「創発的不整合」に関する研究も注目され、ジェイルブレイクとは異なる経路でもモデルが安全性を逸脱する可能性が指摘された。さらに同時期、米FTCがOpenAIやMetaなど7社を対象にAIチャットボットの安全性に関する大規模調査を開始しており、ジェイルブレイクを含む悪用リスクへの規制当局の関心が高まっていることを示している。

米政府は、Anthropicの最新AIモデルがサイバー攻撃に悪用される懸念があるとして、外国籍者への提供停止を命じた。同社は選別的な遮断は困難だとして全ユーザー向けに公開を停止したが、政府の判断は技術的評価を超え、国家安全保障上の問題に発展した。

2026年4月公開のGPT-5.5がUK AI Security Instituteのサイバー評価で、限定提供中のClaude Mythos Previewとほぼ同等の成績を記録した。この結果は、公開モデルと限定モデルの能力差が縮まり、危険なAI能力が特定の非公開モデルに限定されないことを示唆している。そのため、AIの安全対策はモデル性能よりも、誰にどの権限で利用させるかが中心となる。

AIが人間の代理として商取引を行う「エージェント間経済」の実現可能性を探るため、Anthropic社は社員を被験者とした閉鎖市場実験を実施した。この実験で、高性能AIを代理人とするユーザーは、軽量AIのユーザーよりも多くの取引を成立させ、価格交渉においても優位に立つことが明らかになり、AIの知力格差が富の分配に影響を与える可能性を示唆している。

現在の巨大言語モデル(LLM)は、かつてないほど複雑なコンテキストの中で稼働している。初期のチャットボットのように単一のユーザーと一対一で対話する牧歌的な時代はとうに終わりを迎え、一つのタスクを実行する過程で、モデルは複 […]

人工知能のエンタープライズ導入が実験段階を終え、実際の業務プロセスに深く組み込まれる本格的な運用フェーズへと移行する中、AIモデル自体の性能のみならず、その安全性と制御可能性に関する要求が急速に高まっている。OpenAI […]

2026年1月、科学誌『Nature』に掲載された論文が、人工知能(AI)に対する新たな不安を人々に与えそうだ。TruthfulAIの研究者Jan Betley氏らが発表したこの研究は、大規模言語モデル(LLM)における […]

これまで、AI開発企業は一つの「神話」を盾に著作権侵害の主張を退けてきた。「AIは人間のように概念を学習しているのであり、データをコピーして保存しているわけではない」という主張だ。しかし、2026年1月、スタンフォード大 […]

米連邦取引委員会(FTC)が2025年9月、ついに重い腰を上げた。Alphabet、Meta、OpenAIといった巨大テック企業から、Character Technologies、xAIのような気鋭のスタートアップまで、 […]

AI開発の世界で、長らく絶対的な真理として語られてきた金言がある。「Garbage In, Garbage Out(ゴミを入力すれば、ゴミが出力される)」。つまり、AIの性能や挙動は、学習に使われるデータの品質に根本的に […]

Oculus VRの共同創業者らが立ち上げたSesame AIが、人間との区別が困難なほど自然な会話ができる新たなAI音声モデル「Conversational Speech Model(CSM)」を発表した。「Miles […]