Xiaomiは2026年9月22日、大規模AIモデル「MiMo-V2.6」のProとFlashを公開した。最上位のMiMo-V2.6-Proは、第三者評価機関Artificial Analysisの「Intelligence Index」で46を記録し、9月23日の確認時点でオープンウェイトモデルの首位に立っている。Xiaomiの公式発表では小数点以下を含め46.32とされている。
モデルの重みはMITライセンスで公開され、テキストだけでなく画像、動画、音声を入力でき、最大100万トークンのコンテキストを扱う。
ただし、今回の発表を「XiaomiがAIランキングで首位になった」という話だけで読むと、本質を見誤る。
MiMo-V2.6-ProがすべてのAIモデルを上回ったわけではない。むしろ注目すべきなのは、Xiaomiが半年近くかけて構築した大規模な強化学習(RL)の仕組みを、モデルの重みだけでなく学習環境やコードとともに外部へ開放したことだ。
そして実際の利用を考えれば、1兆パラメータを超えるPro以上に、性能を大きく落とさずAPI料金を約3分の1まで削ったFlashの存在が重要になる。
MiMo-V2.6-Proは「オープンウェイト首位」、AI全体の首位ではない
Artificial Analysisが現在使用しているIntelligence Index v4.3.2は、知識労働、エージェントによる業務自動化、端末操作、科学コード、長文推論など10種類の評価をまとめた複合指標である。
9月23日の確認時点でMiMo-V2.6-Proは46。オープンウェイトモデルでは1位だ。
一方、閉鎖モデルまで含めればClaude Opus 5の最大推論設定は51、GPT-5.6 Solの最大設定は47を記録している。AlibabaのQwen3.8 Maxは45、オープンウェイトのKimi K3は44、DeepSeek V4.1 Flashは39だった。
データを表で見る
| Intelligence Index (ポイント) | |
|---|---|
| Claude Opus 5 max | 51 |
| GPT-5.6 Sol max | 47 |
| MiMo-V2.6-Pro | 46 |
| Qwen3.8 Max | 45 |
| Kimi K3 max | 44 |
| DeepSeek V4.1 Flash | 39 |
価格まで含めると、MiMo-V2.6-Proの位置はさらに特徴的になる。
| モデル | 重み | Intelligence Index | AAのタスク当たり費用 | コンテキスト |
|---|---|---|---|---|
| Claude Opus 5(max) | 非公開 | 51 | $5.86 | 1M |
| GPT-5.6 Sol(max) | 非公開 | 47 | $1.99 | 1M |
| MiMo-V2.6-Pro | 公開・MIT | 46 | $0.13 | 1M |
| Qwen3.8 Max | 非公開 | 45 | $5.41 | 984K |
| Kimi K3(max) | 公開 | 44 | $2.00 | 1M |
| DeepSeek V4.1 Flash(max) | 公開 | 39 | $0.27 | 1M |
ここでいう「タスク当たり費用」はAPIの100万トークン単価とは違う。
Artificial Analysisが実際に評価を実行した際の入力、キャッシュ、推論、出力トークンを含め、1タスクを完了するためにかかった費用を加重平均した値だ。
MiMo-V2.6-Proは0.13ドルで、Intelligence Indexが近いモデルよりかなり低い。つまり46という数字以上に、「46をどの程度の費用で出しているか」が特徴になっている。
もっとも、これも絶対的な性能指標ではない。Artificial Analysisの評価セットやモデルの推論設定が変われば数字は動く。
MiMo-V2.6-Proを「最強のAI」と呼ぶのは正確ではなく、「2026年9月23日時点のArtificial Analysis v4.3.2で最高スコアのオープンウェイトモデル」とするのが妥当だ。
Xiaomi自身の評価でも、閉鎖モデルを全面的には上回っていない
この違いはXiaomiが公開しているベンチマークを見るとさらに分かりやすい。
同社のモデルカードでは、MiMo-V2.6をClaude Opus 5、GPT-5.6 Sol、Claude Fable 5などと同じエージェント評価で比較している。
| ベンチマーク | MiMo-V2.6 Pro | MiMo-V2.6 Flash | Claude Opus 5 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|---|---|
| DeepSWE v1.1 | 71.9 | 67.9 | 74.0 | 73.0 | 70.0 |
| AutomationBench v1.0.6 | 53.1 | 52.3 | 50.3 | 45.8 | 46.2 |
| Terminal Bench 4.0 | 34.9 | 28.8 | 49.0 | 39.9 | 42.4 |
| Terminal Bench 2.1 | 89.9 | 87.6 | 89.1 | 88.8 | 84.3 |
| JobBench | 62.0 | 61.2 | 65.7 | 45.4 | 57.4 |
| ExploitBench | 47.9 | 25.3 | 70.0 | 78.5 | 78.0 |
| MiMo Visual Coding | 72.3 | 71.5 | 70.0 | 73.4 | 69.1 |
長時間のソフトウェア開発を測るDeepSWE v1.1ではProの71.9に対し、Claude Opus 5が74.0、GPT-5.6 Solが73.0だった。Terminal Bench 4.0でもMiMoは閉鎖モデルを下回る。
一方、業務操作を含むAutomationBenchではProが53.1、Flashが52.3と比較対象を上回り、Terminal Bench 2.1ではProが89.9だった。
つまりMiMo-V2.6は、すべてのタスクを一様に改善した万能モデルというより、ツールを使いながら長時間作業を進める「エージェント」として急速に能力を伸ばしたモデルと見る方が実態に近い。
1回の更新で2万5,088本:Xiaomiが拡大したのは「経験」の量だった
MiMo-V2.6-Proは総パラメータ数1.02兆、1トークン当たりの活性パラメータ数が420億のMixture of Experts(MoE)モデルだ。
Flashは総3090億、活性150億。両モデルとも最大100万トークンのコンテキストを持ち、テキスト、画像、動画、音声を入力できる。
| MiMo-V2.6 Pro | MiMo-V2.6 Flash | |
|---|---|---|
| 総パラメータ数 | 1.02兆 | 3090億 |
| 活性パラメータ数 | 420億 | 150億 |
| 最大コンテキスト | 100万token | 100万token |
| 事前学習量 | 30兆token | 48兆token |
| アーキテクチャ | MoE | MoE |
| マルチモーダル | 対応 | 対応 |
事前学習量も大きい。
技術報告によればFlashは48兆トークン、Proは30兆トークンで学習された。Flashはテキスト段階26兆とマルチモーダル段階22兆、Proはそれぞれ27兆と3兆だった。
事前学習では32Kから256Kへコンテキストを伸ばし、その後の中間学習でエージェントの作業軌跡を取り込みながら100万トークンへ拡張した。
だがMiMo-V2.6で特徴的なのは、その後である。
XiaomiはRLの1ステップにつき1,568個の課題を選び、それぞれから16本のロールアウトを生成した。
単純計算で、1回の更新につき2万5,088本のエージェント軌跡になる。
ProとFlashはそれぞれ30ステップを実行したため、1モデルにつき約75万本の軌跡を生成した。1ステップで処理される学習トークンは数十億規模となり、技術報告では約27億~37億、公式発表では終盤に35億~37億トークンへ達したとされている。
これは一般的な「質問を与えて回答を採点する」RLとはかなり違う。
1本の軌跡には、コードベースを読む、ファイルを探す、ツールを呼び出す、コードを書き換える、テストする、失敗を観察する、再び修正するといった長時間の作業が含まれる。
平均的な軌跡は11万~15万トークンに達したと報告されている。
Xiaomiが拡大したのは、単なるパラメータ数ではなく、モデル自身に経験させる「試行錯誤の量」だった。
RLだけでProに約262万ドル、それでも半分以上は「学習」以外
このRL実行は6日未満で終了した。
公式発表によると、Proの費用は約262万ドル、Flashは約85万ドルだった。30ステップを通じ、DeepSWE v1.1はProが58.4から72.57、Flashが48.8から65.68まで上昇した。
さらに興味深いのは費用の内訳だ。
Proでは43.8%がロールアウト生成、43.5%が実際のパラメータ学習、12.7%が回答を採点するgraderに使われた。
データを表で見る
| 費用構成比 (%) | |
|---|---|
| ロールアウト生成 | 43.8 |
| モデル学習 | 43.5 |
| 採点・評価 | 12.7 |
つまりRL費用の半分以上が「モデルの重みを更新する計算」ではなく、学習に使う経験を作り、その経験の質を判断する処理に費やされている。
ここにMiMo-V2.6の重要な設計思想がある。
従来のRLでは、テストを通ったか失敗したかという0か1の報酬を使いやすい。しかし、同じテストを通ったコードでも、必要以上に大量の変更を加えた解答と、最小限の変更で問題を正しく直した解答では質が違う。
MiMo-V2.6では同じ課題から生成された複数の軌跡を比較し、成功した解答の中でも質を評価するGroupwise Reward Synthesis(GRS)やGroupwise Advantage Redistribution(GAR)を導入した。
評価側にも計算資源を投入することで、単に「成功した行動」を増やすのではなく、より短く、余計な変更が少ない解決方法へ報酬を寄せる。
モデルを大きくする競争から、「モデルにどれだけ質の高い経験を与えられるか」という競争へ重心が移りつつあることを示す例でもある。
コード、業務操作、視覚、サイバーを同じRLへ入れる
Xiaomiはこの学習方式を「You Only RL Once」と呼ぶ。
コード生成用、PC操作用、視覚エージェント用、サイバーセキュリティ用に別々のモデルを仕上げるのではなく、一つのRL実行へ複数種類の課題と複数のエージェント実行基盤、いわゆるharnessを混ぜる。
モデルに特定のシステムプロンプトやツール構成だけを覚えさせないため、異なるharnessを学習分布の一部として扱った。
ただし、大規模化すると単純な並列処理では回らない。
数分で終わる課題と何十分も続く課題を同じバッチへ入れれば、短い課題ばかり先に終了する。
そこでXiaomiは未完了の軌跡を後から再開するpartial rolloutや、異なる課題の比率を保つsample mixerを導入した。
MoEでは特定expertへ学習負荷が偏る問題が起きたため、RL中はexpertを選択するrouterも固定した。
報酬ハッキングへの対策も必要になる。
モデルが課題そのものを正しく解くのではなく、採点器の弱点を利用するようになれば、大量のRL計算が逆効果になるからだ。
Xiaomiは報酬設計、敵対的評価、異常検知、複数の検証器による照合を組み合わせている。
大規模なエージェントRLでは、モデル本体以上に、タスクの供給、スケジューリング、ツール実行、採点器、推論基盤をまとめて動かすシステムがボトルネックになる。
MiMo-V2.6は、その問題を正面から扱ったモデルと言える。
Proより市場への影響が大きいかもしれないFlash
そして実用面で興味深いのがMiMo-V2.6-Flashだ。
Proが1.02兆パラメータ、活性420億なのに対し、Flashは3090億、活性150億とかなり小さい。
それでもXiaomiの主要なエージェント評価では、多くの項目でProとの差を数ポイント以内に抑えている。
- MiMo-V2.6 Pro
- MiMo-V2.6 Flash
データを表で見る
| MiMo-V2.6 Pro (スコア) | MiMo-V2.6 Flash (スコア) | |
|---|---|---|
| DeepSWE v1.1 | 71.9 | 67.9 |
| AutomationBench | 53.1 | 52.3 |
| Terminal Bench 2.1 | 89.9 | 87.6 |
| JobBench | 62 | 61.2 |
| MiMo Visual Coding | 72.3 | 71.5 |
| Terminal Bench 4.0 | 34.9 | 28.8 |
| ExploitBench | 47.9 | 25.3 |
表で差を見ると、特徴がよりはっきりする。
| 指標 | Pro | Flash | 差 |
|---|---|---|---|
| DeepSWE v1.1 | 71.9 | 67.9 | 4.0 |
| AutomationBench | 53.1 | 52.3 | 0.8 |
| Terminal Bench 2.1 | 89.9 | 87.6 | 2.3 |
| JobBench | 62.0 | 61.2 | 0.8 |
| MiMo Visual Coding | 72.3 | 71.5 | 0.8 |
| Terminal Bench 4.0 | 34.9 | 28.8 | 6.1 |
| ExploitBench | 47.9 | 25.3 | 22.6 |
ところが、API価格は性能差よりはるかに大きく開く。
| モデル | キャッシュ未使用入力 / 100万token | 出力 / 100万token | キャッシュ命中入力 |
|---|---|---|---|
| MiMo-V2.6-Pro | $0.435 | $0.87 | $0.0036 |
| MiMo-V2.6-Flash | $0.14 | $0.28 | $0.0028 |
| Pro UltraSpeed | $4.35 | $8.70 | $0.036 |
- MiMo-V2.6 Pro
- MiMo-V2.6 Flash
データを表で見る
| MiMo-V2.6 Pro (ドル) | MiMo-V2.6 Flash (ドル) | |
|---|---|---|
| 非キャッシュ入力 | 0.44 | 0.14 |
| 出力 | 0.87 | 0.28 |
Flashの通常入力価格はProの32.2%、つまり約68%安い。出力もほぼ同じ比率である。
これはエージェント用途では無視できない差になる。
例えば一度の回答だけなら数十セントの差は小さい。
しかし、エージェントが計画を立て、複数のサブエージェントを呼び出し、コードを読み、ツールを実行し、失敗すれば再試行する構成では、1つのユーザー操作から数十回、数百回のモデル呼び出しが発生することがある。
その場合、最高性能を数ポイント上げることより、十分な成功率を保ったモデルを3倍近く多く試せることの方が、システム全体の成功率を高める場合がある。
ただし、Flashを単なる「安いPro」と考えるのも危険だ。
Terminal Bench 4.0では34.9対28.8、ExploitBenchでは47.9対25.3まで差が広がる。
タスクによってはモデル規模の差が明確に表れる。
実運用ではFlashを通常処理や大量の並列試行へ使い、難易度が高い、あるいは失敗コストの大きい仕事だけProへエスカレーションする構成が考えられる。
ただし、その判断は公開ベンチマークではなく、自社のツール、プロンプト、データ、harnessを使ったタスク単位の成功率で決める必要がある。
7,000超のRL環境を公開した意味
今回のリリースでもう一つ異例なのが、モデルの重みだけで終わらなかったことだ。
XiaomiはProとFlashに加え、技術報告、エンドツーエンドのRLフレームワーク、軽量なmini-harness、そして7,000件を超えるRL用タスク環境を公開した。
環境はソフトウェア開発、脆弱性再現、知識集約型作業、Webデザイン・開発などを対象とする。
RLフレームワークはverl、uni-agent、mini-swe-agentなどを基盤に、環境操作、軌跡収集、報酬評価、方策最適化までを扱う。
さらに、巨大なProやFlashを再学習できない研究者向けに「MiMo-V2.6-Distill-Qwen-9B」も用意した。
これはQwen3.5-9BをMiMoが生成したデータで教師あり微調整したモデルで、SFTデータは合計774億トークン、そのうち272億トークンが実際に損失計算へ使われるloss-bearing tokenだった。
Xiaomiはこの9Bモデルを出発点として公開RL環境で学習させた結果、報告したすべての指標でSFT版を上回ったとしている。
| ベンチマーク | SFT | RL後 | 改善幅 |
|---|---|---|---|
| SWE-bench Verified | 61.1 | 66.2 | +5.1 |
| MiMo Cyber Bench | 31.3 | 47.0 | +15.7 |
| Terminal Bench 2.1 | 37.1 | 52.8 | +15.7 |
| MiMo Visual Coding | 64.0 | 72.4 | +8.4 |
- SFTのみ
- RL後
データを表で見る
| SFTのみ (スコア) | RL後 (スコア) | |
|---|---|---|
| SWE-bench Verified | 61.1 | 66.2 |
| MiMo Cyber Bench | 31.3 | 47 |
| Terminal Bench 2.1 | 37.1 | 52.8 |
| MiMo Visual Coding | 64 | 72.4 |
ここに今回の公開の長期的な価値がある。
1.02兆パラメータのモデルを公開されても、数千枚規模のGPUを用意できない研究者は同じRLを再現できない。
しかし、9Bモデル、課題環境、採点器、harness、学習コードが同時に提供されれば、「複数のharnessを混ぜた学習は本当に未知の環境への適応を改善するのか」「groupwise gradingは別モデルでも効果があるのか」といった要素を、小さな計算規模で切り分けて検証できる。
Artificial Analysisの首位は、次のモデルが登場すれば失われる。
しかし、この訓練環境やRL手法が他の開発者に再利用されれば、MiMo-V2.6の影響はランキングより長く残る可能性がある。
「活性420億」だから420億パラメータモデルと同じ、ではない
オープンウェイトであることも、運用が容易という意味ではない。
Proは1トークンにつき420億パラメータしか活性化しないが、モデル全体には1.02兆パラメータが存在する。
推論時の演算量を考える上では活性パラメータ数が重要だが、モデルを保存し、expertをGPU間に配置する際には全体の重みを扱わなければならない。
Xiaomiの公式モデルカードで紹介されているPro向けSGLang構成も、16-way tensor parallelismとexpert parallelismを使い、複数GPU、複数ノードでの実行を想定している。
「活性420億」という数字だけを見て、420億パラメータ級の通常モデルと同じ感覚で1台のGPUへ載せられると考えてはいけない。
このため、多くの利用者にとって「オープンウェイト」は必ずしも「自社サーバーで動かした方が安い」という意味にならない。
API料金、GPU調達費、稼働率、キャッシュ率、レイテンシ、データ所在地、運用要員まで含めて比較する必要がある。
1トークンの価格ではなく「1タスクを成功させる費用」で比較する
MiMo-V2.6が示したもう一つの変化は、AIモデルの価格比較そのものだ。
100万トークン当たり0.14ドルか0.435ドルかを見るだけでは、エージェントの経済性は分からない。
重要なのは、1つの仕事を完了するまでに何トークン使い、何回失敗し、何回やり直し、何秒かかるかである。
例えば安価なモデルでも、成功するまで3回やり直せば、高価だが1回で終わるモデルより高くなる場合がある。
一方、FlashのようにProとの差が小さい仕事では、単価差がそのまま大きなコスト差になる。
Artificial AnalysisがMiMo-V2.6-Proについて、100万トークン当たりの単価とは別に「Intelligence Indexの1タスク当たり0.13ドル」と算出しているのは、この違いを捉えるためだ。
同社の測定ではMiMo-V2.6-Proの出力速度も約130トークン/秒に達している。
今後エージェントモデルを選ぶ際には、
「どのモデルが最も賢いか」
だけではなく、
「成功したタスク1件当たり、いくらかかったか」
という指標の方が重要になっていくだろう。
MiMo-V2.6の本当の勝負はこれから始まる
MiMo-V2.6-ProのArtificial Analysis Intelligence Index「46」は分かりやすいニュースだ。
しかし、その数字だけなら寿命は短い。AIモデルのランキングは次の有力モデルが登場すれば塗り替えられる。
今回より重要なのは、Xiaomiが1モデルにつき約75万本もの長時間エージェント軌跡を生成し、ロールアウトだけでなくgraderにも大規模な計算資源を割き、異なる種類のタスクとharnessを一つのRLへ混ぜ、それを支える環境とコードまで公開したことである。
さらに商用利用では、Flashが多くの評価でProに近い性能を保ちながら、通常API料金を約3分の1まで下げている。
今後見るべき点は二つある。
一つは、Flashが実際の開発、調査、業務自動化などでProに近い「タスク成功率」を維持できるのか。
もう一つは、公開された9Bモデルと7,000超のRL環境を使い、Xiaomi以外の研究者が同じ方向の改善を再現できるのかだ。
そこまで確認されて初めて、MiMo-V2.6の6日間の大規模RLは「高性能な巨大モデルをもう一つ作った出来事」ではなく、エージェントをどう鍛えるかという工程そのものを外部へ渡した出来事だったと評価できる。
順位より、その方がはるかに長く残る可能性がある。



