GoogleやGoogle DeepMindなどの研究者が、AIエージェントの探索履歴を再生し、次の探索の進め方を改善する「Dream-RSI」を公開した。2026年9月14日付のプレプリントで、同じGemini 3.1 Proを使う固定探索と比べ、統計計算プログラムを探す呼び出し回数を約42.4%減らし、完成したプログラムの平均実行時間も短縮したと報告している。過去の試行を「夢」のように振り返る手法だが、更新するのはモデルの重みではなく、探索を続ける場所や打ち切る時点を決めるコードだ。成果の意味は、平均値の内訳と、再生できる履歴の範囲を分けて見ると明確になる。
過去の探索を、戦略の試験場にする
Dream-RSIは、コードを書くエージェントの上に、探索の配分を決める仕組みを置く。どの候補を改良するか、別の方向を何本並行して試すか、いつ終了するか。この「探索戦略」を実行可能なコードとして表し、繰り返し書き換える。
候補プログラムを生成し、実行して評価し、有望な案をさらに改良する流れは、Google DeepMindが2025年5月に発表したAlphaEvolveにも見られる。ところが、探索戦略そのものを比べようとすると、各戦略に長い探索を走らせ、結果が出るまで待たなければならない。解を探すための計算に加えて、「どう探すか」を試す計算も膨らむ。
Dream-RSIが再利用するのは、その過程で残った探索の記録だ。候補がどの候補から派生したかを木構造で保持し、コードや作業環境の状態、評価結果も保存する。探索戦略を変更した後は、この木を違う順番や並列数でたどり直す。途中で打ち切る判断も試せる。結果はすでに記録されているため、再生のたびに候補を生成し直したり、評価器を動かしたりする必要がない。
続いて、戦略を改訂するエージェントが再生結果を手掛かりにコードを書き換え、蓄積した履歴で最も良かった戦略を次の実探索へ投入する。そこで得た履歴が、次の再生に使える範囲を広げる。解を作るモデルと評価器を固定したまま、計算の使い方を改善するのが、この研究でいう再帰的な自己改善である。AlphaEvolveの製品更新として発表されたものではない。
平均18%短縮の内訳を読む
研究チームは、統計手法Lassoの正則化パスを計算するプログラムで、探索の効率と完成コードの速度を調べた。Lassoは多数の説明変数から有用なものを選ぶ際などに使われる。探索には17の合成問題を使い、得られたプログラムを探索用とは別の6データセットで評価した。
主な対照は、探索戦略を更新しない「Recursive Fixed Exploration」だ。モデルや評価器、初期状態、各ラウンドの資源制約をそろえ、最初は同じ手設計の戦略から始める。Lassoでは5ラウンドを実施した。Gemini 3.1 Proの場合、固定探索の呼び出し回数は累計550回、Dream-RSIは317回で、削減率は約42.4%となる。
完成プログラムの平均実行時間は3,587.1msから2,931.0msへ、約18%短縮した。ただし、論文の図3(a)をデータセット別に比較すると、効果は均一ではない。
| 評価データセット | 固定探索で得たプログラム | Dream-RSIで得たプログラム |
|---|---|---|
| Gisette | 1,861.8ms | 2,841.0ms |
| RCV1 | 19,550.1ms | 14,616.0ms |
| DNA | 41.5ms | 49.9ms |
| Leukemia | 26.1ms | 30.2ms |
| Colon | 14.5ms | 16.4ms |
| Duke Breast | 28.4ms | 32.5ms |
| 平均 | 3,587.1ms | 2,931.0ms |
出典:Dream-RSI論文v1、図3(a)。いずれもGemini 3.1 Proを使い、5ラウンドの探索後に同じ6データセットで評価した著者報告値。小さいほど速い。独立した追試の結果ではない。
Gemini 3.1 Proでは、平均実行時間が約18.3%短くなった一方、個別に高速化したのは6データセット中RCV1だけで、残る5つでは実行時間が延びた。
平均の短縮率は「(3,587.1−2,931.0)÷3,587.1」を百分率に直せば算出できる。RCV1での短縮が他の5件の増加を上回り、平均を押し下げている。したがって、この結果から期待できる効果は、利用するデータの構成によって変わる。平均値だけで、どのLasso処理も速くなるとは判断できない。
Gemini 3.7 Flashでは、呼び出し回数が3,200回から1,879回へ減り、平均実行時間も2,516.7msから2,350.6msに短縮した。こちらは6件中5件で固定探索を上回る。研究チームも、Proで得たプログラムはRCV1のような大規模行列に、Flashで得たプログラムは異なる規模の問題に広く適した結果と説明している。
一方、目を引く「約162倍」という数字は、別の発見システムSimpleTESの51,200回と、Dream-RSIの317回を割った比較だ。SimpleTES側のモデルはGPT-OSS-120Bであり、同じモデルで探索戦略だけを変えた実験とは条件が異なる。探索エージェントの呼び出し回数の比を、費用や所要時間の比へ置き換えることもできない。
GPUでは改善、数学では勝敗が分かれる
GPU向けの処理コードを作る実験では、Gemini 3.1 Proを使い、KernelBenchの4課題を評価した。数値的に正しいことを確認したうえで、実行時間の逆数を性能指標としている。比較対象は同じ固定探索だ。
| GPU課題 | 論文が報告する固定探索との差 |
|---|---|
| VGG16 | 同等の性能に達する生成回数が約2.43分の1 |
| LayerNorm | 同等の性能に達する生成回数が約1.79分の1 |
| ConvDiv | 同程度の探索予算で、完成コードの性能が約2.09倍 |
| ConvMax | 同程度の探索予算で、完成コードの性能が約1.44倍 |
出典:Dream-RSI論文、図4・第4.3節。前半2件は必要な生成回数、後半2件は完成コードの実行性能を比較している。
同じ性能へ少ない試行で到達する効果と、同程度の試行予算で速いコードを得る効果が示された。ただし、この4件の結果をGPU処理全般の速度向上率として使うことはできない。
数学の3課題では、勝敗が分かれた。和差問題では固定探索を上回り、円充填では論文の比較対象中の最良値に並んだ。一方、小さい値ほど良い自己相関の課題では、Dream-RSIが1.456375、固定探索が1.456001で、固定探索を下回る。探索戦略の更新が、すべての目的関数で有利になるわけではない。
履歴の使い方を比べた実験も興味深い。ConvDivでは、過去の探索を要約して「次はこの方向を探す」といった指示を加えると、固定探索とDream-RSIの双方で、指示を加えない場合より成績が悪くなった。著者らは、方向づけが強すぎると探索の幅を狭める可能性を指摘する。対象はこの課題と指示の与え方であり、エージェントの記憶や指示全般が無益だという証拠ではない。
「夢」が保証するのは、記録済みの世界まで
再生中のDream-RSIは、履歴に存在しない結果を作れない。枝の内部では、過去に記録された親子関係の順序で結果を取り出す。新しい枝を開く場合も、記録済みの候補を順に参照する。未知の状況を予測する世界モデルと比べ、結果を推測せずに評価できる反面、まだ試していない場所の価値は測れない。
戦略の採点にも設計上の選択がある。論文第3節では、得られた最良解の品質に、試行数を減点する項と並列実行を評価する項を組み合わせている。何を高く評価するかを決める仕組みは固定され、その基準に沿って探索戦略が改良される。
現行の戦略も候補に含めるため、選ばれた戦略の平均再生スコアは、同じ履歴上では悪化しない。しかし、新しい探索ではモデルの生成結果が変わり得る。**過去の履歴での非悪化は、次の探索での性能保証ではない。**実探索を繰り返して履歴を広げる工程が必要なのは、この制約があるためだ。
費用も再生と実探索を分けて考える必要がある。記録を読み出す評価では、解候補を再生成する呼び出しを省ける。それでも、探索戦略のコードを書き換えるモデルの処理や、履歴の保存・再生には計算資源を使う。論文が探索費用の指標とする累計呼び出し回数だけでは、こうした処理を含む総費用の削減率は確定しない。
2026年9月21日時点で、著者の公開リポジトリはコード全体と再現用スクリプトを準備中としている。論文付録には発見したLassoプログラムの実装が載るが、探索から戦略更新までの全工程を再現する配布物とは区別が必要だ。
導入を判断するには、自分たちの処理対象でも改善するかに加え、戦略の改訂を含めた総費用を測る必要がある。その条件が確かめられれば、既に使っているモデルの探索記録を、次の試行を減らすための材料として活用できる。
