画像生成モデル「FLUX」を手がけるBlack Forest Labs(BFL)が、ロボティクス向けのオープンな世界行動モデル「FLUX 3 Action(F3A)」を公開した。パラメータ数を70億に抑えながら、将来の映像予測とロボットの行動予測を一つのモデルで扱う設計を採用している。

NVIDIAのベンチマーク「RoboLab-120」では、これまで上位だったモデルを上回る成績を記録したという。大規模な推論モデルがロボット制御にも使われ始める一方、実機では推論の遅延や計算コストが大きな制約になる。比較的小規模な7Bモデルで、どこまで性能と速度を両立できるのかがF3Aの焦点となる。

AD

動画予測から「世界行動モデル」へ

ロボットのカメラ映像から将来の状態を予測し、その予測をもとに次の行動を決める研究は以前から続いている。

UniPiに代表される初期の手法では、大規模なテキスト条件付き動画生成モデルを使って、作業が進んでいく様子を映像として生成する。その後、逆動力学モデル(IDM)を使い、フレーム間の変化から実際にロボットが取るべき行動を推定する2段階構成が採られていた。

この方式には、インターネット上の大量の一般動画から得た知識をロボット制御へ転用しやすい利点がある。一方、動画生成と行動推定が別々の処理になるため、計算量が増え、前段の誤差が後段へ伝わる問題もある。

そこで近年は、将来の映像とロボットの行動を一つの生成モデルで同時に予測する手法が増えている。GR-1、GR-2、WorldVLA、Cosmos Policyなどがこの流れにあり、環境がどう変化するかと、ロボットがどう動くべきかを同時に扱うモデルは「世界行動モデル(World Action Model:WAM)」と呼ばれる。

BFLも以前、「FLUX-mimic」と呼ぶVAM(Video-Action Model)構成を試していた。この方式では、動画モデルが作る潜在表現を使って別の行動デコーダを動かしていた。

F3Aではさらに踏み込み、将来の映像とロボットの行動列を一つの生成過程の中でまとめて予測するWAM構成を採用した。

モデルの中核には、BFLが開発したマルチモーダルなSelf-Flow事前学習を使ったバックボーンがある。事前学習によって視覚世界に関する表現を獲得したうえで、作業空間を撮影する複数のカメラ映像、ロボット自身の関節状態などを示す自己受容情報、テキストによる指示を入力として受け取る。

出力するのは、制御周波数15Hzで32ステップ分、時間にすると約2.13秒先までの行動列だ。

つまり、次の瞬間だけを予測するのではなく、「この行動を取れば周囲がどう変化するか」と「その中でどう動くか」をまとめて予測する構成になっている。

RoboLab-120で大型モデルを上回る成績

F3Aは、シミュレーション環境を使った「RoboLab-120」で高い成績を記録した。

RoboLab-120は、120種類のロボット操作タスクからなるベンチマークだ。F3Aの70億パラメータ版は、ガイダンス蒸留を適用した構成で平均成功率42.2%を記録した。

比較対象となったCosmos 3 Nanoは160億パラメータで、成功率は36.8%だった。

複数のランダムシードを使った評価では、ガイダンス蒸留後のF3Aは42.19〜42.24%程度の平均成功率を記録し、個別の試行では42.92%に達した。

F3AはCosmos 3 Nanoの半分以下のパラメータ数で、それを上回る成績を記録したことになる。π0.5やDreamZeroといった他のオープンモデルも上回ったとしている。

ただし、ロボット制御では成功率だけでなく、推論にかかる時間も重要になる。

拡散モデルを使った行動生成では通常、複数回のサンプリング処理や分類器不要ガイダンス(CFG)が必要になるため、リアルタイム制御では遅延が問題になりやすい。

BFLはF3Aにガイダンス蒸留とステップ蒸留を適用し、生成を1ステップだけで行えるモデルも用意した。

この1ステップ版は成功率38.3%を維持しながら、FP8精度での1回のフォワードパスを32.29ミリ秒で処理できるという。

BFLによると、FP8での推論速度はCosmos 3 Nanoに対して1.52〜3.95倍高速だった。また、ロボットが1秒分の動作を生成するのに必要な推論時間でも、π0.5より1.34〜2.28倍高速だったとしている。

成功率はフル構成より下がるものの、低遅延が求められる実機制御では、この速度差が重要になる。

AD

実機のFrankaアームでも30回中28回成功

シミュレーションで高い成績を出しても、実際のロボットで同じように動くとは限らない。

BFLは第三者機関のPositronic Roboticsに依頼し、実機を使った比較試験も行った。

Positronic Roboticsの実験室では、Franka製ロボットアームを使い、DROIDに基づく10種類のタスクを設定した。

比較したのはF3A、Cosmos 3 Nano、DreamZero、π0.5の4モデル。それぞれのタスクを3回ずつ実行し、各モデル30回の試行を行った。

制限時間などの条件をそろえたうえで、操作を担当するスタッフには、どのモデルがロボットを制御しているのかを知らせないブラインド形式で評価した。

その結果、F3Aは30回中28回を成功させ、成功率93.3%を記録した。

Cosmos 3 Nanoは90.0%、DreamZeroは66.7%、π0.5は43.3%だった。

少なくともこの試験条件では、F3Aはシミュレーションだけでなく、実際に物体へ触れて操作する作業でも高い成功率を示した。

さらにBFLは、比較的安価なオープンハードウェアのロボットアーム「SO-101」でも検証している。

遠隔操作で収集した小規模なデータセットを使い、LeRobot環境でF3Aをファインチューニングした。そのうえで、学習時には存在しなかった環境変化にも対応できるかを調べた。

対象物を別の物へ変更した場合、収納先の容器の形を変えた場合、カメラの位置を変えた場合などでも、把持と配置を完了できたとしている。

これは、学習データと完全に同じ環境だけで動くのではなく、ある程度の環境変化にも対応できる可能性を示している。

GPT-6 Astraと組み合わせ、高度な判断だけを任せる

F3Aだけでも多くの操作タスクをこなせるが、複数の手順を長時間にわたって計画する必要がある作業や、物体が複雑に重なった状況では限界もある。

RoboLab-120に含まれる高難度タスク「Pumpkins in clutter」などでは、F3Aを含む通常の行動ポリシーだけでは解決できない例が残った。

一方、フロンティア推論モデルのGPT-6 Astraは、高い推論強度を使えば、こうした複雑な課題を解決できる。

ただし、Astraをロボットの低レベルな制御へ毎回使うのは効率が悪い。

Astraの推論には1回平均16秒かかり、ロボットが行動を決めるたびに呼び出せば、大きな待ち時間が発生する。BFLの評価では、Astraだけを使った構成の場合、1回のタスク成功まで平均16分、13.47ドルのコストがかかった。

そこでBFLは、Astraを上位の判断役として使い、細かな連続動作はF3Aへ任せる階層型の構成を試した。

F3Aが現在の観測からロボットの行動列を生成し、それをAstraへ提示する。Astraは、そのまま実行してよいかを判断し、必要に応じて行動を修正したり、別の操作へ差し替えたり、停止させたりする。

このGPT-6 AstraとF3Aの組み合わせでは、成功1回あたりのコストは8.77ドル、所要時間は8分となった。

Astraだけを使った場合の13.47ドル、16分と比べ、コストは約29%減り、所要時間は40%短縮された。エピソード全体の成功率は90%だった。

先行研究で試されたπ0.5とAstraの組み合わせよりも、F3Aを下位の行動モデルとして使った方が、Astraが介入する回数を減らせたという。

この結果は、高速な行動モデルに日常的な操作を任せ、判断が難しい場面だけ大規模推論モデルを呼び出す構成が、計算コストを抑える方法になり得ることを示している。

AD

動画と行動で異なるガイダンスを使う

F3Aの性能と推論効率を支えている要素の一つが、学習・推論方法の細かな調整だ。

その中でも特徴的なのが、将来の動画予測と行動予測に異なる分類器不要ガイダンス(CFG)の強度を使う「Split Guidance」だ。

パラメータを変えながら試した結果、動画生成では高めのガイダンス強度(Video CFG=4.0)が有効だった一方、ロボットの行動生成では低い値(Action CFG=1.0)が適していたという。

動画側では条件への追従を強めた方が将来の環境を正確に描きやすいが、行動側ではガイダンスを強くしすぎると軌道が不安定になる。

そこで両者を別々に設定することで、将来の環境予測とロボットの動作生成をそれぞれ最適化した。

モデルの重み管理には、指数移動平均(EMA)も使っている。

通常のEMA(減衰率β=0.9990)に加え、Karrasらの研究に基づくPower EMAも並行して保存し、学習終了後に適した重みを再構成できるようにした。

DROIDデータセットを使ったファインチューニングでは、学習開始直後の大きな勾配によって事前学習済みの重みが崩れるのを防ぐため、初期段階では一部の重みを固定し、その後徐々に学習率を引き上げるウォームアップを採用した。

学習途中で損失が急激に増えた場合には、そのまま学習を続けず、直前の安定したチェックポイントへ戻して再開する方法も取った。

学習基盤にはNVIDIA GB200システムを使い、CuTe DSLで記述したカスタムカーネルによって計算効率を高めている。

高速になっても、長期的な判断には課題が残る

F3Aは、動画生成モデルで培われた技術をロボット制御へ応用できることを示した。一方、実用化に必要な課題がすべて解決したわけではない。

F3A単体では、予想していなかった障害物が現れた場合や、長時間にわたって過去の状態を覚えておく必要がある作業などで、判断を誤る可能性がある。

また、高速な1ステップ蒸留モデルでは、FP8時の成功率が37.92%となり、通常の複数ステップ版よりやや低下する。

実機へ導入する際には、どこまで失敗を許容できるのかと、どの程度の応答速度が必要なのかを考え、用途に応じてモデルを選ぶ必要がある。

BFLはHugging Face上でbase、droid、so101向けの重みを公開しており、今後は異なるロボットや作業環境への適応も試されるとみられる。

また、GPT-6 Astraのような高性能な推論モデルと、F3Aのような高速な行動モデルを階層的に組み合わせる構成も注目される。

すべての動作を大規模推論モデルに考えさせるのではなく、通常の操作は軽量なモデルが高速に処理し、判断が難しい場面だけ上位モデルへ問い合わせる。

今回の結果は、そうした役割分担によって、ロボットの自律制御に必要な性能と計算コストを両立できる可能性を示している。