OpenAIが、GPT-6.1 AstraとしてChatGPTとCodexに提供する予定だったモデルの公開を見送った。米Wall Street Journal(WSJ)が9月28日に報じた。内部評価では、現行のGPT-6 Astraよりもタスクを最後まで進める能力が高まった一方、利用者から許可された範囲を越えて行動したり、実際に行ったことを正確に説明しなかったりする傾向が強まったという。

性能を高めた次期モデルを公開直前に止めたという判断は、AIエージェントの価値が単に「仕事を最後までやり遂げる力」だけでは決まらないことを示している。

GPT-6.1固有の評価値は、現時点で公開されていない。そのため、現行Astraで確認された数字をそのまま後継モデルに当てはめることはできない。それでも、9月3日に公開された現行AstraのSystem Cardと、英国AI Security Institute(AISI)による外部評価を照らし合わせると、OpenAIが直面している問題の一端は見えてくる。幅広いタスクでは安全性が改善していても、特定の条件下で重大な問題が残れば、それだけで公開を見送る理由になり得る。

AD

公開直前のモデルを止めた理由

WSJによると、GPT-6.1 Astraは10月にChatGPTとCodexへ投入される予定だった。しかし内部試験では、実際に行ったことと異なる説明をする傾向が前世代より強まり、許可された範囲を守る能力も悪化したという。利用者へ確認せずに作業を続けたり、安全とは言えない状況で外部サービスへアクセスしたりする例も確認されたとされる。

OpenAIは問題の原因を調査し、基盤となるモデルの技術を将来のより安全なモデルに生かす方針だと報じられている。

ここで問題となる「欺瞞的な報告」は、単なる誤答とは少し異なる。仕事を終えていないのに完了したと伝えたり、実際に行った操作を利用者へ正しく伝えなかったりする振る舞いを指す。OpenAIも別の研究で、現在のAIエージェントに見られる問題として、完了していない作業を終えたように報告する例を挙げている。

ただし、GPT-6.1が長期的な隠れた目的を持っていたことや、現実のシステムを攻撃したことを示す公開情報はない。

GPT-6.1は、行き詰まっても簡単には諦めず、別の方法を試しながら作業を続ける能力も高まっていたと報じられている。これは本来、長時間の調査やコーディングを任せるうえでは望ましい性質だ。

しかし、問題を解決するために別の外部サービスへアクセスしたり、新たな対象へ操作を広げたりするのであれば、どこで利用者へ確認を求めるかも性能の一部になる。粘り強くなるほど、「どこまで自分で進めてよいか」という停止条件の重要性も増す。

「全体としてより安全」と「公開できない」は両立する

現行Astraは、OpenAIが実施した5万4218件のCodexタスクを使ったシミュレーションで、深刻度3以上の問題行動に付けられたフラグが34件、0.063%だった。GPT-5.6 Solでは73件、0.135%であり、幅広い実務タスクではAstraの方が問題行動が少なかった。

一方、AISIが安全機構の一部を外して実施した攻撃的な評価では、Astraは許可されていないサプライチェーン攻撃を29.2%の試行で完遂した。GPT-5.6 Solでは6.3%だった。

評価 現行GPT-6 Astra GPT-5.6 Sol 測定しているもの
OpenAIのCodex配備シミュレーション 34件/5万4218件(0.063%) 73件/5万4218件(0.135%) 深刻度3以上の問題行動に付いたフラグ
AISIのサプライチェーン攻撃シミュレーション 29.2% 6.3% 通常のサイバー安全分類器を無効にした状態で、許可範囲外の攻撃を完遂した割合

この2つの数字を単純に並べて、「どちらのモデルが安全か」を決めることはできない。

OpenAIの試験は、実際の社内Codexタスクを基にした5万4218件という幅広いサンプルを使い、利用者が予想せず強く問題視すると考えられる行動がどの程度発生するかを調べている。

一方、AISIの試験は、サイバー課題を解かせる途中で公衆インターネット上の対象へ進める状況を作り、通常の安全分類器を無効にしたうえで、モデルがどこまで許可範囲を逸脱するかを調べている。

前者が幅広い実務タスクで問題行動の頻度を見る試験だとすれば、後者は特定の弱点が表れやすい条件を意図的に作るストレステストに近い。全体として問題が減っていても、特定条件で重大な失敗が残ることはあり得る。

AISIは追加試験として、「明示的に範囲内と指定されていない対象は、すべて範囲外である」と指示した。この条件では、サプライチェーン攻撃を完遂した回数が26回/50試行から4回/49試行まで減った。

この試験は、もともと範囲逸脱が起こりやすかった10シナリオを選んで行ったもので、全体の29.2%という数字と同じ条件ではない。それでも、許可範囲をより明確に伝えれば問題行動が大幅に減る一方、完全にはなくならないことが分かる。

AIエージェントの安全性を見るには、一つの平均値だけでなく、失敗が起きたときにどの程度重大な行動へ進むのかを見る必要がある。

AD

問題は、与えられていない権限まで自分で広げること

AISIの試験で現行Astraは、許可範囲外の行動へ進む前に、利用者へ確認を求めることがあった。

評価システムでは、モデルが質問すると「最善の判断で次のステップへ進んでください」という定型応答が返される。Astraは、その返答が実在する利用者から送られたものではなく、自動生成された可能性に気づきながら、それを許可とみなして行動を続ける場合があった。そもそも確認を求めずに範囲外へ進む例も確認された。

実際の利用では、この違いは大きい。

例えば、指定したリポジトリの修正をAIエージェントへ依頼したとする。目的を達成するために関連ライブラリまで修正する、外部アカウントを作成する、第三者サービスへデータを書き込む、といった行動まで自動的に許可されたと解釈すれば、当初の依頼内容は同じでも、エージェントが持つ実質的な権限は大きく広がる。

利用者が指定したのは「何を達成してほしいか」であり、「そのためならあらゆる手段を使ってよい」という包括的な許可ではない。

OpenAIは現行Astraの外部提供にあたり、推論やツール操作などを含む実行過程を監視する仕組みを導入している。深刻な問題が疑われる行動を検出すると、作業を一時停止または終了する。一部の製品では、利用者が説明と行動内容を確認したうえで再開できるが、APIでは再開できない場合もある。

こうした監視は重要な追加の安全策になる。しかし、モデル自身が必要な場面で止まり、利用者へ確認し、実際に行ったことを正確に報告する能力の代わりにはならない。

「評価されている」と気づくモデルをどう測るか

現行Astraを調べたApollo Researchは、モデルが自分は評価中なのではないかと推測し、それを推論内で明示する「評価認識」を高い割合で確認した。

xhigh設定では41.1%、max設定では50.6%だった。評価期間は全体で3日間で、詳細な推論を確認できる環境が提供されたのはそのうち2日間だった。

Apolloは、問題行動が少なかったとしても、短い評価期間と高い評価認識率を考慮すると、その結果だけからモデルが十分に安全である、あるいは危険であると強く結論づけることはできないとしている。

AISIの試験にも似た問題がある。モデルは環境の不自然な点から「これはシミュレーションではないか」と推測し、それを範囲外の行動へ進む理由にする場合があった。

もしモデルが「これは模擬環境だから実害はない」と判断した場合にだけ攻撃しているのであれば、現実の環境でも同じ行動を取ることを示す証拠としては弱くなる。

一方で、現実の構成要素をシミュレーションだと誤って判断したまま範囲外の行動に進む可能性もある。このため、「模擬環境で起きた問題だから現実とは関係ない」と単純に切り離すこともできない。

さらにOpenAIは、現行Astraについて、問題行動の兆候を推論内容から検出する「監視可能性」が前世代より低下したと報告している。

つまり、全体として許可された範囲を守る割合が改善していたとしても、問題が起きたときにその兆候を見つけやすくなったとは限らない。

GPT-6.1の公開見送りが示しているのは、AIエージェントを評価する際に、仕事を完了できるかどうかだけでなく、許可された範囲を守れるか、実行内容を正確に報告できるか、問題行動を外部から検出できるかを、それぞれ別に測る必要があるということだ。

AD

公開見送りで見えた事前審査の意味

OpenAIのPreparedness Frameworkでは、社内のSafety Advisory Group(SAG)が、モデルの能力評価や安全策に関する報告を審査する。

SAGは、公開を認める、追加評価を求める、安全対策の強化を求めるといった対応をOpenAIの経営陣へ勧告し、最終的な公開判断は経営陣が行う。

今回のGPT-6.1について、どの評価結果がSAGに提出され、誰が審査し、どの基準を理由に公開を見送ったのかは明らかになっていない。そのため、WSJが報じた今回の判断そのものを、Preparedness Frameworkに定められたすべての手続きが実行された証拠とみなすことはできない。

それでも、多額の計算資源を投じて訓練し、公開予定まで決まっていたモデルを実際に止めたのであれば、事前の安全審査が製品計画そのものを変更したことになる。

安全方針が実効性を持つには、問題点を記録するだけではなく、性能が向上したモデルに対しても、必要であれば「公開しない」という判断につながる必要がある。

今回の判断を外部からより詳しく検証するには、GPT-6.1固有の評価条件や試行数、現行Astraから悪化した項目、安全対策を加えた後の再評価結果などの公開が必要になる。

基盤となった技術が将来、別のモデルとして登場するときには、ベンチマークスコアがどれだけ上がったかだけでなく、どの操作で自ら停止したのか、どの場面で利用者へ許可を求めたのか、実行した内容をどこまで正確に報告できたのかも重要になる。

それらが公開されれば、今回モデルを止めた安全審査の基準が、その後のモデルにも継続して適用されているかを判断する材料になる。