Odysseyは2026年10月8日、操作に応じて変化する世界モデル「Odyssey-3」の研究プレビューを公開した。9月15日の技術紹介に続き、ブラウザで生成世界に入り込める体験と、学習方法や物理ベンチマークの結果を示した形だ。公開サイトへ案内されるモデルはOdyssey-3 Flashで、一人称・三人称での移動や、独立したカメラ操作に対応する。

同社が進めているのは、映像の先を予測する知識を共有し、ロボットや車の操作にも使う試みである。ただし、物理ベンチマークで示した66.1点には、8本を生成して1本を選ぶという条件が付く。操作できる映像と、現実の機械が頼れる予測の間を、どこまで埋められたのか。今回の発表は、その仕組みと評価の両方を考える材料を増やしている。

AD

操作で変わる映像を、過去から予測し続ける

Odyssey-3では、テキストで環境を指定した後も、利用者の移動や途中で起こす出来事に応じて生成が続く。直前までに見えていた世界と、新しく加わった入力を使って、次の状態を予測する。右へ向けば、右側で何が見えるかを生成するわけだ。操作のたびに、その先の展開が変わる。

この連続した予測を担うのが、自己回帰型の拡散トランスフォーマーである。拡散モデルは、段階を踏んで映像を作る。そこに過去の観測から次の状態へ進む仕組みを組み合わせ、利用者が後から加える操作に応答させる。Odysseyは、学習時に正解の過去映像を与えて続きを予測させ、未来の映像を参照できない「因果マスク」を使うと説明している。

学習データにも、操作と結果を結ぶ工夫がある。ネット上の動画には、いつ何が起きたかを記した注釈を付ける。ゲームの録画では、映像とキーボード・マウスの入力時刻をそろえる。さらに、剛体がぶつかったり動いたりするシミュレーションと、その状況を示す説明を加える。広い視覚経験に、行動が世界をどう変えるかという対応関係を重ねる構成だ。

応答速度を支えるのは、生成手順を減らす「蒸留」である。同社は、映像の分布を元のモデルに近づける訓練に、敵対的な蒸留を組み合わせたとしている。こうして、少ない手順で動くリアルタイム版を作る。重いモデルで学んだ予測能力を、対話に使える短い処理へ移す。

過去から映像を逐次生成する方式は、Odyssey-2でも説明されていた。第3世代の進展は、その方式を土台に、物理挙動の評価や機械制御への応用を示し、新しい研究プレビューを公開した点にある。映像が動く速さに加えて、予測した世界がどれほど実際の世界に近いかが問われるようになった。

66.1点の内訳で見える、評価条件の重み

Odysseyは、Odyssey-3 ProがPhysics-IQ Verifiedの動画から動画を生成する評価で66.1点を得たと発表した。このベンチマークは、実際の物理実験を撮影した動画の続きを生成し、実際に起きた結果と比べる。流体や固体の動きに加え、光学、磁気、熱の振る舞いも対象になる。

公式リポジトリへの提出資料を条件別に並べると、最高点が何を意味するかが分かる。Odyssey-3 Proの66.10点は8候補から1本を選ぶ1回評価で、同じプロンプト強化を使う通常生成の4回平均は63.37±0.63点だった。

モデル プロンプト 1課題の生成・選択 評価回数 スコア
Odyssey-3 基本の説明文 1本を生成 4回 51.76±0.69
Odyssey-3 説明文を強化 1本を生成 4回 61.56±1.20
Odyssey-3 Pro 説明文を強化 1本を生成 4回 63.37±0.63
Odyssey-3 Pro 説明文を強化 8本から1本を選択 1回 66.10

表はOdysseyが2026年10月8日付で報告したV2Vの結果を、モデルと生成条件で分けたものだ。198課題それぞれについて、3秒の動画を入力し、生成した続きの最初の5秒を16fpsで評価している。「±」は4回の生成結果に対する標本標準偏差を示す。通常版は832×480、Proは1280×720で、同じ解像度どうしの比較ではない。

説明文の強化にも別のAIを使う。提出資料によれば、入力の映像を見たモデルが説明文を書き換えるが、正解となる続きの映像は見せない。8候補からの選択も正解映像を使わず、世界モデルの評価手法「WMReward」と、候補どうしの一致度による順位を合わせる。予測器に加えて、入力を整える処理と出力を選ぶ処理が結果に含まれる。

そこで、最高点と安定した通常生成を分けて読む必要がある。ベンチマークの公式ルールは、1回の結果でもランキングへ掲載する一方、最高性能を主張する場合には4回の評価と標準偏差の報告を求めている。66.10点は掲載済みの結果だが、8候補選択によるこの数字だけでは、その記録主張の要件を満たさない。数値自体もOdysseyによる提出で、第三者が同じ条件で再測定した結果とは区別される。

公開版の体験へ数字を持ち込む際にも注意が要る。提出では50段階の生成手順を使っており、少ない手順で動くFlashの実測値としては扱えない。また、通常版は140億パラメーターと明記されているが、ProやFlashの規模を同じ値とする根拠はない。発表のコスト比較も、AMDのMI355Xを1時間1ドルで使う仮定から換算し、候補選択の計算を除外している。商用APIの利用料金とは別の数字である。

AD

同じ知識からロボットや車の操作を学ぶ

Odysseyのロボット実験では、数十時間の実演データを使い、物体の操作に加えて失敗からの復帰も示したという。つかみ損ねた後にグリッパーの向きを変える、普段と違う位置に落ちた物を拾い直す、といった動作である。同社は、そうした復帰の例が訓練用の実演には含まれていなかったと説明している。

映像を作るモデルが機械を動かすには、もう一つの学習が必要になる。9月の技術紹介によれば、機械の観測と、そのとき取った行動を組にして、モデルの内部表現を操作へ変換する「行動デコーダー」や制御方策を学ぶ。世界モデルは、操作したら何が起きるかを予測する。制御方策は、観測した状態から次に何をするかを選ぶ。両者は、世界について学んだ表現を共有する。

人型ロボットでは、FlexionがOdyssey-3を基盤に制御方策を開発した。数十時間の遠隔操作データに加え、Flexion側のロボット学習と全身制御の研究・実装が組み合わされている。Odysseyは、比較したVLA、すなわち視覚・言語・行動を扱うモデルが照明変化で失敗する場面でも、共同開発の制御は動作を続けたとする。ただし、紹介記事には比較モデルの名前や試行数、成功率が明記されていない。あらゆる環境での優位を示したものとして読むには、追加の評価が要る。

自動運転の実験は、共有する知識と機械固有の学習の関係をさらに明確にしている。Odysseyは、事前学習済みモデルの重みを固定したまま、20時間のシミュレーション運転データで小さな制御方策を訓練した。映像から得た内部表現を使って車の前方の通過点を予測し、インドの実道路で周囲の観測に応じて運転する。20時間は、この制御を学ぶ追加データの量であり、基盤モデルの事前学習全体を表す数字ではない。

同社は、シミュレーションだけで学んだ制御と、実際の運転映像で学んだ制御を比べた。安全運転者の介入から次の介入までに走れた距離は、前者が後者の約77%だったという。これは同社内の二つの制御を比べた介入間距離の比率で、77%の運転に成功したという意味ではない。具体的な走行距離や試行回数、結果のばらつきは公表されておらず、通常の道路交通での安全性を判断できる段階には届いていない。

それでも、追加学習の役割を機械ごとの操作へ絞れるなら、実演データを集める負担を減らす道が開ける。ロボットごとにあらゆる失敗と復帰を教えるのは難しい。広い映像経験から得た予測表現が、実演されていない状況でも役立つか。その検証が、共有基盤を使う価値を決める。

1本の正しさと、何度も試した世界の正しさ

生成世界の操作性を測るWorldMarkでは、Odyssey-3は同社の測定で4区分中3区分の首位だった。ベンチマークの説明文を使い、13のスコアを平均した結果である。一人称の様式化した世界は77.2点、三人称の実写風は79.0点、三人称の様式化は76.3点となる。一方、一人称の実写風では80.6点で、Lyra 2.0の84.4点とAlayaWorldの83.0点に続く3位だった。

WorldMarkの設計は、映像が鮮明かどうかに加え、操作へどう応答するかを問う。進めという指示に進み、操作を反転させれば動きも変わるか。視線を外してから戻したとき、同じ街並みが残っているか。こうした操作と記憶の性質を別々に測る。9種類の指標のうち、操作に関する4指標は移動と回転を分けるため、結果表では13のスコアになる。平均順位が高くても、特定の動作や長時間の記憶まで同じように優れるとは限らない。

周辺モデルとの違いは、操作の受け取り方にもある。WorldMarkの分類では、Matrix-Game 3.0はキー操作を直接受け取り、Lyra 2.0はフレームごとのカメラ軌道を受け取る。評価側は、共通の方向操作をモデルごとの形式へ変換している。対してOdyssey-3の公開プレビューでは、環境をテキストで指定し、移動やカメラ操作、途中の出来事を入力する。同じ操作軸で比べても、キーを渡す仕組みと軌道を渡す仕組み、利用者向けの操作画面は分けて読む必要がある。Odyssey-3をWorldMarkで評価した際の入力変換は公表されておらず、この比較から他モデルに特定の機能がないとまでは言えない。

さらにOdyssey自身は、8月に公開したCaliBenchで、物理シミュレーションに別の問いを立てていた。同じ初期状態から何度も動画を生成したとき、結果が現実と同じ分布になるか、という問いである。公正なサイコロなら、各面が出る確率は6分の1だ。毎回自然に転がっていても、いつも同じ面で止まるなら、その世界は確率まで再現できていない。

この違いは、機械の訓練に使うときに効く。めったに起こらない危険な展開を生成しないシミュレータなら、そこで何度試しても、現実で遭遇する失敗を学べない。もっとも、CaliBenchで評価されたモデルにOdyssey-3は含まれていない。同モデルの分布が誤っていると示した結果はなく、66.1点から分布の正しさを読み取ることもできない。良い1本を選ぶ能力と、多数の未来を正しい頻度で生成する能力は、別々に確かめる必要がある。

研究プレビューを試す際は、見た目とともに、指示を切り替えたときの応答や、一度離れた場所へ戻った際の一貫性を見るとよい。その先の実用化では、実機の失敗率や介入間距離を実験条件とともに示し、生成した未来の分布も検証することが求められる。それらを積み上げられれば、Odysseyが目指す世界モデルは、機械が現実に出る前に失敗を経験し、少ない追加データで新しい操作を学ぶための場になり得る。


Sources


AD

推奨Slug

odyssey-three-world-model-physical-control

画像・図解案 (with Generative AI Prompts)

  1. アイキャッチ

    • Prompt:Wide editorial illustration, 16:9. A human hand on a keyboard in the foreground, facing a monitor showing a photorealistic sunlit street that extends into an imagined navigable world. Subtle alternate motion paths suggest that user actions change the scene's future. Restrained blue and amber palette, sophisticated realistic lighting, clear focal hierarchy, generous negative space. Conceptual illustration of an interactive AI world model, not a screenshot or a product interface. No text, no logos, no claims of real deployment.
    • Filename:odyssey-three-interactive-world.webp
  2. 挿絵

    • Prompt:Clean technical editorial illustration on an off-white background, landscape 16:9. At center a shared abstract visual memory represented by a compact network of translucent scene fragments. On the left, a sequence of camera observations and an action arrow lead to an imagined next frame. On the right, the same visual memory feeds a separate small control module connected to a robot gripper reaching for a simple box. Distinct paths clearly separate environment prediction from action selection. Precise restrained linework, navy, teal and warm gray. No text, no brand logos, no numerical labels, no anthropomorphic brain.
    • Filename:odyssey-three-prediction-control.webp
  3. インフォグラフィック

    • Prompt:Conceptual infographic in a crisp editorial style, landscape 16:9, ivory background. Two equal groups of physically plausible dice-roll outcomes. The left group contains many neatly rendered dice all showing the same face; the right group shows a balanced variety of the six faces. Below each group, a simple unlabeled histogram conveys concentrated versus spread outcomes, using the same six-bin layout. The illustration explains that plausible individual videos can still have an unrealistic distribution; it does not represent measured Odyssey-3 results. Navy outlines with subtle terracotta and teal accents, generous spacing, no words, no percentages, no logos.
    • Filename:world-model-outcome-distributions.webp

タイトル案

  1. 歩き回れるAI世界をブラウザで、Odyssey-3の研究プレビュー公開と物理評価の内訳
  2. 映像から学んだ知識でロボットを動かす、Odyssey-3公開が示す予測と制御のつながり
  3. 物理評価66.1点は8本から選んだ結果、Odyssey-3の研究プレビュー公開で見えた課題