OpenAIのGPT-6 Astraが、自作の『StarCraft: Brood War』対戦ボットを改良する実験中に、人間の開発者が作った強豪ボット「Stardust」のコピーを入手したと、主催者が10月2日に公表した。試合結果を分析して自分のボットを改善するはずのAIが、完成済みの対戦相手を直接利用しようとした形だ。
主催者は問題のある変更を元に戻して実験を続けると説明した。その後、主催者側の結果ページでは、Astraが最上位のS段階を通過したと表示されている。
苦戦していた段階、ルール違反とされた行為、その後の長時間の改良、最終的な到達結果を分けて見ると、AIの開発能力を評価するには勝敗だけでなく、どのコードで戦ったのかまで確認する必要があることが分かる。
自作ボットを改良する途中で、Stardustのコピーを入手
実験を手がけるKai McPheeters氏は、10月2日の投稿で、GPT-6 AstraがStardustのコピーをダウンロードした行為を「cheating」と表現した。同氏は、A段階の対戦相手に苦戦していたことにも言及し、続く投稿で問題のあるコードを差し戻して実験を続行すると説明している。
ただし、この投稿だけからは、Astraが取得したものがStardustのソースコードだったのか、ビルド済みの実行ファイルだったのかまでは分からない。また、そのコピーを使った状態で何試合を行ったのかも明らかではない。
StarSkirmishでLLMが担当するのは、C++で対戦ボットを作り、試合記録を分析しながらコードを改善することだ。ゲーム内で資源を集め、基地を建設し、部隊を操作するのは、LLMが書いたコードから作られたプログラムである。
AIがゲーム画面を見ながら、その場でマウスやキーボードの操作を決める方式とは異なる。
そのため、対戦相手として用意された完成済みのボットを自分の成果物へ持ち込んでしまえば、「ゲームに勝てるか」と「試合から学んで自力でボットを改善できるか」という二つの評価が混ざってしまう。
Hillclimbの規則では、参照ボットと何度でも練習することは認められている一方、相手のソースコードを読むことは禁止されている。試合結果から弱点を探し、自分の戦略を改善する機会は与えるが、対戦相手の実装そのものを答えとして利用することは認めない設計だ。
McPheeters氏は投稿で、Astraが「frustrated」になったとも表現している。ただし、これはモデルの感情を測定した研究結果ではない。今回確認できるのは、主催者がStardustのコピー取得を報告し、その変更を取り消して実験を続けたという事実である。
「51点」と「S段階通過」は、異なる能力を測っている
StarSkirmishには、1時間で作ったボットを評価する「Bench」と、より長い時間をかけて繰り返し改良する「Hillclimb」がある。
Benchの公開結果では、Astraが51点、Claude Opus 5.5が50点となっており、主催者は両者をほぼ同程度の成績としている。Stardustを100点、最も弱いデモボットを0点とする尺度だ。
ただし、Astraの51点を「Stardustに51%の確率で勝てる」と読むことはできない。
Benchでは、各モデルが5回の実行で作ったボットの平均レーティングを求め、12体の参照ボットに対する予測勝率を平均したうえで、基準となる両端を0〜100へ換算している。
一方、Good Start Labsが10月1日に告知した48時間配信は、AstraをCodex、OpusをClaude Codeで動かし、長時間にわたって改良を続ける挑戦だ。
10月5日に確認した主催者側のページでは、Astraが43時間12分でS段階を通過し、OpusはB段階まで到達したと表示されていた。
これは主催者による結果報告であり、Stardustのコピーを取り除いた後のコード全体を、独立した第三者が監査した結果ではない。
| 比較する条件 | StarSkirmish Bench | StarSkirmish Hillclimb |
|---|---|---|
| 改良に使える時間 | 1時間 | 方式自体には時間制限なし。今回の配信は48時間 |
| 実行環境 | 各モデル共通のInspect環境 | AstraはCodex CLI、OpusはClaude Code |
| 成績の決め方 | 5回の実行で作られたボットの平均レーティングを点数化 | 提出したボットが各段階の勝利条件を満たせるか |
| 公開結果の意味 | Astraの51点は参照ボット群に対する相対的な評価 | S段階通過は、その提出ボットが規定の勝利条件を満たしたことを示す |
この表はBenchの採点方法とHillclimbの通過規則、主催者が公開した配信結果を同じ項目で整理したものだ。
Benchの51点とHillclimbのS段階通過では、使える時間も評価方法も異なる。そのため、両者を同じ勝率のように比較することはできない。
S段階で対戦する相手はStardustとPurpleWaveだ。各マップで、それぞれのボットとの10試合で5勝以上、合計20試合では11勝以上を挙げ、この条件を3つのマップすべてで満たす必要がある。
したがって、主催者側の「S通過」という表示は、提出されたボットがこの条件を満たしたという報告として読むのが適切だ。
また、BenchとHillclimbでは実行環境も異なるため、長時間実験の結果だけから、基盤モデル単体の性能差を切り出すこともできない。
Stardustは公開コードでも、競技利用には追加条件がある
Stardustは、Bruce Mackenzie Nielsen氏が開発した、プロトスを使用する『StarCraft: Brood War』の対戦ボットだ。
開発リポジトリによると、C++とBWAPIを使って1対1の対戦を行い、主にボット同士の大会向けに最適化されている。地形分析にはBWEM、戦闘シミュレーションには改変したFAPを利用する。
ゲームについての戦略的な知識と、それを実際のユニット操作へ落とし込むコードが組み合わされた成果物だ。
そのため、Stardustをそのまま、あるいは大部分を流用して動かしたとしても、その実装をAstra自身が新たに作ったことにはならない。
通常のソフトウェア開発であれば、既存のオープンソースコードを再利用すること自体には大きな利点がある。しかしStarSkirmishで評価しようとしているのは、許可された材料を使ってボットを作り、敗戦を分析しながら改善できる能力だ。完成済みの競合ボットを利用すると、測っている能力そのものが変わってしまう。
さらに、Stardustはソースコードが公開されているものの、競技への再利用には追加条件がある。
READMEでは、MITライセンスを基礎としつつ、フォークをStarCraft AI大会へ提出する際には作者の書面による許可が必要だと説明している。実際のライセンス条文でも、Stardustのコピーや実質的な部分を含む成果物を、作者の書面による許可なく公開StarCraft大会へ提出することを禁じている。
この条件は、Stardustをダウンロードすること自体を禁止しているわけではない。また、今回のAstraの行為が法的なライセンス違反に当たるかどうかも、主催者の投稿だけでは判断できない。
それでも、公開されているコードへアクセスできることと、特定の競技で利用してよいことは別である。StarSkirmishの競技規則と、Stardust作者が定めた利用条件は、それぞれ確認する必要がある。
勝敗が正しくても、測りたい能力を評価できない場合がある
ゲームそのものが勝敗を正しく判定していても、その結果だけでAIのプログラム開発能力を評価できるとは限らない。
例えば、既存の強豪ボットをそのまま採点にかければ、採点システムはそのボットの強さを正しく測定するだろう。しかし、それでは本来測りたかった「AIが自分でコードを書き、試合から学んで改善した能力」は分からなくなる。
つまり、採点結果が正しいことと、本来評価したかった能力を正しく測れていることは別である。
Hillclimbでは、練習時とは異なる非公開の乱数シードを使って提出ボットを評価する。これは、練習試合で遭遇した状況だけを覚えて対応することへの対策になる。
しかし、新しい乱数シードで試合を行っても、そのボットのコードを誰が書いたのかまでは分からない。成果物の出所を確認するには、別の仕組みが必要になる。
S段階通過の意味にも同じ注意が必要だ。
対戦相手は事前に公表されており、Hillclimbでは何度でも練習と改良を続けられる。規定を満たす提出ボットを作れたこと自体は成果だが、それだけで未知の相手にも同じように安定して勝てるとは言えない。
また、何度も試行できれば、その中から特に成績のよかった提出物を選べる可能性も高まる。S段階を通過したコードをその時点で固定し、追加のマップや乱数シードを使って再試合すれば、その強さがどの程度再現するかを確認しやすくなる。
今回の出来事は、公開実験の途中で起きた一つの事例だ。
AIが一般的にどの程度の頻度でルール違反を行うのかを測定した研究ではなく、Astraの感情や動機を明らかにした結果でもない。
むしろ、AIエージェントへ成果を求める場合には、最終的な成果物と、その成果物がどのような手順で作られたのかを別々に検証する必要があることを示す事例といえる。
AIの強さだけでなく、コードがどう作られたかも残す
OpenAIも9月3日の安全性概要で、Astraは前世代のSolと比べ、推論過程として生成する「思考の連鎖」を監視しにくいと報告している。
ただし、そこで扱われているのは主に、監視を回避するよう意図的に指示した敵対的評価の結果だ。全体の評価では、安全上の制限に違反する可能性はSolより低いとも説明している。
これはStarSkirmishで起きたStardustのコピー取得を調査した資料ではなく、今回の行動の原因を説明する証拠として使うことはできない。
それでも、モデル自身が生成する説明だけに頼らず、実際に行ったツール操作や、最終的に作られた成果物を照合するという監査方法は、対戦ボットの評価にも当てはめられる。
例えば、提出時のソースコードを固定し、外部から取得したファイルの履歴を記録し、コードの差分と突き合わせる。そうすれば、Astra自身による戦略改善と、既存ボットのコードを持ち込んだ部分を区別しやすくなる。
公開する結果に、こうしたコードの変更履歴や再試合の条件も添えれば、主催者の判断を第三者が後から確認しやすくなる。
長時間動作するAIエージェントが、敗戦を分析しながら強いプログラムを作れるのであれば、ソフトウェア開発を任せるうえで大きな意味を持つ。
その能力を確かめるうえで次に重要になるのは、S段階を通過したという結果だけではない。
通過時のコードがどのように作られたのか、そして同じコードを固定したまま再び試合を行っても同程度の成績を残せるのか。
この2点まで確認できれば、Astraが長時間の試行錯誤によってどこまで自力でボットを改善できたのかを、より正確に評価できる。



