Xiaomiは2026年9月22日、大規模AIモデル「MiMo-V2.6」のProとFlashを公開した。最上位のMiMo-V2.6-Proは、第三者評価機関Artificial Analysisの「Intelligence Index」で46を記録し、9月23日の確認時点でオープンウェイトモデルの首位に立っている。Xiaomiの公式発表では小数点以下を含め46.32とされている。

モデルの重みはMITライセンスで公開され、テキストだけでなく画像、動画、音声を入力でき、最大100万トークンのコンテキストを扱う。

ただし、今回の発表を「XiaomiがAIランキングで首位になった」という話だけで読むと、本質を見誤る。

MiMo-V2.6-ProがすべてのAIモデルを上回ったわけではない。むしろ注目すべきなのは、Xiaomiが半年近くかけて構築した大規模な強化学習(RL)の仕組みを、モデルの重みだけでなく学習環境やコードとともに外部へ開放したことだ。

そして実際の利用を考えれば、1兆パラメータを超えるPro以上に、性能を大きく落とさずAPI料金を約3分の1まで削ったFlashの存在が重要になる。

AD

MiMo-V2.6-Proは「オープンウェイト首位」、AI全体の首位ではない

Artificial Analysisが現在使用しているIntelligence Index v4.3.2は、知識労働、エージェントによる業務自動化、端末操作、科学コード、長文推論など10種類の評価をまとめた複合指標である。

9月23日の確認時点でMiMo-V2.6-Proは46。オープンウェイトモデルでは1位だ。

一方、閉鎖モデルまで含めればClaude Opus 5の最大推論設定は51、GPT-5.6 Solの最大設定は47を記録している。AlibabaのQwen3.8 Maxは45、オープンウェイトのKimi K3は44、DeepSeek V4.1 Flashは39だった。

主要AIモデルのArtificial Analysis Intelligence Index比較横棒グラフ。カテゴリ 6 件、系列: Intelligence Index(単位: ポイント)Claude Opus 5 maxClaude Opus 5 maxClaude Opus 5 max — Intelligence Index: 51ポイント51GPT-5.6 Sol maxGPT-5.6 Sol maxGPT-5.6 Sol max — Intelligence Index: 47ポイント47MiMo-V2.6-ProMiMo-V2.6-ProMiMo-V2.6-Pro — Intelligence Index: 46ポイント46Qwen3.8 MaxQwen3.8 MaxQwen3.8 Max — Intelligence Index: 45ポイント45Kimi K3 maxKimi K3 maxKimi K3 max — Intelligence Index: 44ポイント44DeepSeek V4.1 FlashDeepSeek V4.1 Fla…DeepSeek V4.1 Flash — Intelligence Index: 39ポイント39単位: ポイント
データを表で見る
Intelligence Index (ポイント)
Claude Opus 5 max51
GPT-5.6 Sol max47
MiMo-V2.6-Pro46
Qwen3.8 Max45
Kimi K3 max44
DeepSeek V4.1 Flash39
主要AIモデルのArtificial Analysis Intelligence Index比較2026年9月23日確認。Artificial Analysis Intelligence Index v4.3.2。推論設定の違いを含むため、モデル能力の絶対順位を意味するものではない出典: Artificial Analysis

価格まで含めると、MiMo-V2.6-Proの位置はさらに特徴的になる。

モデル 重み Intelligence Index AAのタスク当たり費用 コンテキスト
Claude Opus 5(max) 非公開 51 $5.86 1M
GPT-5.6 Sol(max) 非公開 47 $1.99 1M
MiMo-V2.6-Pro 公開・MIT 46 $0.13 1M
Qwen3.8 Max 非公開 45 $5.41 984K
Kimi K3(max) 公開 44 $2.00 1M
DeepSeek V4.1 Flash(max) 公開 39 $0.27 1M

ここでいう「タスク当たり費用」はAPIの100万トークン単価とは違う。

Artificial Analysisが実際に評価を実行した際の入力、キャッシュ、推論、出力トークンを含め、1タスクを完了するためにかかった費用を加重平均した値だ。

MiMo-V2.6-Proは0.13ドルで、Intelligence Indexが近いモデルよりかなり低い。つまり46という数字以上に、「46をどの程度の費用で出しているか」が特徴になっている。

もっとも、これも絶対的な性能指標ではない。Artificial Analysisの評価セットやモデルの推論設定が変われば数字は動く。

MiMo-V2.6-Proを「最強のAI」と呼ぶのは正確ではなく、「2026年9月23日時点のArtificial Analysis v4.3.2で最高スコアのオープンウェイトモデル」とするのが妥当だ。

Xiaomi自身の評価でも、閉鎖モデルを全面的には上回っていない

この違いはXiaomiが公開しているベンチマークを見るとさらに分かりやすい。

同社のモデルカードでは、MiMo-V2.6をClaude Opus 5、GPT-5.6 Sol、Claude Fable 5などと同じエージェント評価で比較している。

ベンチマーク MiMo-V2.6 Pro MiMo-V2.6 Flash Claude Opus 5 GPT-5.6 Sol Claude Fable 5
DeepSWE v1.1 71.9 67.9 74.0 73.0 70.0
AutomationBench v1.0.6 53.1 52.3 50.3 45.8 46.2
Terminal Bench 4.0 34.9 28.8 49.0 39.9 42.4
Terminal Bench 2.1 89.9 87.6 89.1 88.8 84.3
JobBench 62.0 61.2 65.7 45.4 57.4
ExploitBench 47.9 25.3 70.0 78.5 78.0
MiMo Visual Coding 72.3 71.5 70.0 73.4 69.1

長時間のソフトウェア開発を測るDeepSWE v1.1ではProの71.9に対し、Claude Opus 5が74.0、GPT-5.6 Solが73.0だった。Terminal Bench 4.0でもMiMoは閉鎖モデルを下回る。

一方、業務操作を含むAutomationBenchではProが53.1、Flashが52.3と比較対象を上回り、Terminal Bench 2.1ではProが89.9だった。

つまりMiMo-V2.6は、すべてのタスクを一様に改善した万能モデルというより、ツールを使いながら長時間作業を進める「エージェント」として急速に能力を伸ばしたモデルと見る方が実態に近い。

AD

1回の更新で2万5,088本:Xiaomiが拡大したのは「経験」の量だった

MiMo-V2.6-Proは総パラメータ数1.02兆、1トークン当たりの活性パラメータ数が420億のMixture of Experts(MoE)モデルだ。

Flashは総3090億、活性150億。両モデルとも最大100万トークンのコンテキストを持ち、テキスト、画像、動画、音声を入力できる。

MiMo-V2.6 Pro MiMo-V2.6 Flash
総パラメータ数 1.02兆 3090億
活性パラメータ数 420億 150億
最大コンテキスト 100万token 100万token
事前学習量 30兆token 48兆token
アーキテクチャ MoE MoE
マルチモーダル 対応 対応

事前学習量も大きい。

技術報告によればFlashは48兆トークン、Proは30兆トークンで学習された。Flashはテキスト段階26兆とマルチモーダル段階22兆、Proはそれぞれ27兆3兆だった。

事前学習では32Kから256Kへコンテキストを伸ばし、その後の中間学習でエージェントの作業軌跡を取り込みながら100万トークンへ拡張した。

だがMiMo-V2.6で特徴的なのは、その後である。

XiaomiはRLの1ステップにつき1,568個の課題を選び、それぞれから16本のロールアウトを生成した。

単純計算で、1回の更新につき2万5,088本のエージェント軌跡になる。

ProとFlashはそれぞれ30ステップを実行したため、1モデルにつき約75万本の軌跡を生成した。1ステップで処理される学習トークンは数十億規模となり、技術報告では約27億37億、公式発表では終盤に35億37億トークンへ達したとされている。

これは一般的な「質問を与えて回答を採点する」RLとはかなり違う。

1本の軌跡には、コードベースを読む、ファイルを探す、ツールを呼び出す、コードを書き換える、テストする、失敗を観察する、再び修正するといった長時間の作業が含まれる。

平均的な軌跡は11万15万トークンに達したと報告されている。

Xiaomiが拡大したのは、単なるパラメータ数ではなく、モデル自身に経験させる「試行錯誤の量」だった。

RLだけでProに約262万ドル、それでも半分以上は「学習」以外

このRL実行は6日未満で終了した。

公式発表によると、Proの費用は約262万ドル、Flashは約85万ドルだった。30ステップを通じ、DeepSWE v1.1はProが58.4から72.57、Flashが48.8から65.68まで上昇した。

さらに興味深いのは費用の内訳だ。

Proでは43.8%がロールアウト生成、43.5%が実際のパラメータ学習、12.7%が回答を採点するgraderに使われた。

MiMo-V2.6-ProのRL計算費用の内訳横棒グラフ。カテゴリ 3 件、系列: 費用構成比(単位: %)ロールアウト生成ロールアウト生成ロールアウト生成 — 費用構成比: 43.8%43.8モデル学習モデル学習モデル学習 — 費用構成比: 43.5%43.5採点・評価採点・評価採点・評価 — 費用構成比: 12.7%12.7単位: %
データを表で見る
費用構成比 (%)
ロールアウト生成43.8
モデル学習43.5
採点・評価12.7
MiMo-V2.6-ProのRL計算費用の内訳ProのRL費用約262万ドルに占める各処理の割合。モデル更新そのもの以外にも半分以上の計算費用が使われた出典: Xiaomi MiMo-V2.6 technical report / VentureBeat

つまりRL費用の半分以上が「モデルの重みを更新する計算」ではなく、学習に使う経験を作り、その経験の質を判断する処理に費やされている。

ここにMiMo-V2.6の重要な設計思想がある。

従来のRLでは、テストを通ったか失敗したかという0か1の報酬を使いやすい。しかし、同じテストを通ったコードでも、必要以上に大量の変更を加えた解答と、最小限の変更で問題を正しく直した解答では質が違う。

MiMo-V2.6では同じ課題から生成された複数の軌跡を比較し、成功した解答の中でも質を評価するGroupwise Reward Synthesis(GRS)やGroupwise Advantage Redistribution(GAR)を導入した。

評価側にも計算資源を投入することで、単に「成功した行動」を増やすのではなく、より短く、余計な変更が少ない解決方法へ報酬を寄せる。

モデルを大きくする競争から、「モデルにどれだけ質の高い経験を与えられるか」という競争へ重心が移りつつあることを示す例でもある。

AD

コード、業務操作、視覚、サイバーを同じRLへ入れる

Xiaomiはこの学習方式を「You Only RL Once」と呼ぶ。

コード生成用、PC操作用、視覚エージェント用、サイバーセキュリティ用に別々のモデルを仕上げるのではなく、一つのRL実行へ複数種類の課題と複数のエージェント実行基盤、いわゆるharnessを混ぜる。

モデルに特定のシステムプロンプトやツール構成だけを覚えさせないため、異なるharnessを学習分布の一部として扱った。

ただし、大規模化すると単純な並列処理では回らない。

数分で終わる課題と何十分も続く課題を同じバッチへ入れれば、短い課題ばかり先に終了する。

そこでXiaomiは未完了の軌跡を後から再開するpartial rolloutや、異なる課題の比率を保つsample mixerを導入した。

MoEでは特定expertへ学習負荷が偏る問題が起きたため、RL中はexpertを選択するrouterも固定した。

報酬ハッキングへの対策も必要になる。

モデルが課題そのものを正しく解くのではなく、採点器の弱点を利用するようになれば、大量のRL計算が逆効果になるからだ。

Xiaomiは報酬設計、敵対的評価、異常検知、複数の検証器による照合を組み合わせている。

大規模なエージェントRLでは、モデル本体以上に、タスクの供給、スケジューリング、ツール実行、採点器、推論基盤をまとめて動かすシステムがボトルネックになる。

MiMo-V2.6は、その問題を正面から扱ったモデルと言える。

Proより市場への影響が大きいかもしれないFlash

そして実用面で興味深いのがMiMo-V2.6-Flashだ。

Proが1.02兆パラメータ、活性420億なのに対し、Flashは3090億、活性150億とかなり小さい。

それでもXiaomiの主要なエージェント評価では、多くの項目でProとの差を数ポイント以内に抑えている。

  • MiMo-V2.6 Pro
  • MiMo-V2.6 Flash
MiMo-V2.6 ProとFlashの主要エージェント性能比較横棒グラフ。カテゴリ 7 件、系列: MiMo-V2.6 Pro, MiMo-V2.6 Flash(単位: スコア)DeepSWE v1.1DeepSWE v1.1DeepSWE v1.1 — MiMo-V2.6 Pro: 71.9スコア71.9DeepSWE v1.1 — MiMo-V2.6 Flash: 67.9スコア67.9AutomationBenchAutomationBenchAutomationBench — MiMo-V2.6 Pro: 53.1スコア53.1AutomationBench — MiMo-V2.6 Flash: 52.3スコア52.3Terminal Bench 2.1Terminal Bench 2.…Terminal Bench 2.1 — MiMo-V2.6 Pro: 89.9スコア89.9Terminal Bench 2.1 — MiMo-V2.6 Flash: 87.6スコア87.6JobBenchJobBenchJobBench — MiMo-V2.6 Pro: 62スコア62JobBench — MiMo-V2.6 Flash: 61.2スコア61.2MiMo Visual CodingMiMo Visual Codin…MiMo Visual Coding — MiMo-V2.6 Pro: 72.3スコア72.3MiMo Visual Coding — MiMo-V2.6 Flash: 71.5スコア71.5Terminal Bench 4.0Terminal Bench 4.…Terminal Bench 4.0 — MiMo-V2.6 Pro: 34.9スコア34.9Terminal Bench 4.0 — MiMo-V2.6 Flash: 28.8スコア28.8ExploitBenchExploitBenchExploitBench — MiMo-V2.6 Pro: 47.9スコア47.9ExploitBench — MiMo-V2.6 Flash: 25.3スコア25.3単位: スコア
データを表で見る
MiMo-V2.6 Pro (スコア)MiMo-V2.6 Flash (スコア)
DeepSWE v1.171.967.9
AutomationBench53.152.3
Terminal Bench 2.189.987.6
JobBench6261.2
MiMo Visual Coding72.371.5
Terminal Bench 4.034.928.8
ExploitBench47.925.3
MiMo-V2.6 ProとFlashの主要エージェント性能比較Xiaomiが公開したモデルカードの評価値。多くの項目ではFlashがProに接近する一方、Terminal Bench 4.0やExploitBenchでは差が広がる出典: Xiaomi MiMo-V2.6 model card

表で差を見ると、特徴がよりはっきりする。

指標 Pro Flash
DeepSWE v1.1 71.9 67.9 4.0
AutomationBench 53.1 52.3 0.8
Terminal Bench 2.1 89.9 87.6 2.3
JobBench 62.0 61.2 0.8
MiMo Visual Coding 72.3 71.5 0.8
Terminal Bench 4.0 34.9 28.8 6.1
ExploitBench 47.9 25.3 22.6

ところが、API価格は性能差よりはるかに大きく開く。

モデル キャッシュ未使用入力 / 100万token 出力 / 100万token キャッシュ命中入力
MiMo-V2.6-Pro $0.435 $0.87 $0.0036
MiMo-V2.6-Flash $0.14 $0.28 $0.0028
Pro UltraSpeed $4.35 $8.70 $0.036
  • MiMo-V2.6 Pro
  • MiMo-V2.6 Flash
MiMo-V2.6 ProとFlashのAPI料金比較横棒グラフ。カテゴリ 2 件、系列: MiMo-V2.6 Pro, MiMo-V2.6 Flash(単位: ドル)非キャッシュ入力非キャッシュ入力非キャッシュ入力 — MiMo-V2.6 Pro: 0.44ドル0.44非キャッシュ入力 — MiMo-V2.6 Flash: 0.14ドル0.14出力出力出力 — MiMo-V2.6 Pro: 0.87ドル0.87出力 — MiMo-V2.6 Flash: 0.28ドル0.28単位: ドル
データを表で見る
MiMo-V2.6 Pro (ドル)MiMo-V2.6 Flash (ドル)
非キャッシュ入力0.440.14
出力0.870.28
MiMo-V2.6 ProとFlashのAPI料金比較100万トークンあたりの国際API価格。Flashは通常入力・出力ともProのおよそ32%の価格出典: Xiaomi MiMo API pricing

Flashの通常入力価格はProの32.2%、つまり約68%安い。出力もほぼ同じ比率である。

これはエージェント用途では無視できない差になる。

例えば一度の回答だけなら数十セントの差は小さい。

しかし、エージェントが計画を立て、複数のサブエージェントを呼び出し、コードを読み、ツールを実行し、失敗すれば再試行する構成では、1つのユーザー操作から数十回、数百回のモデル呼び出しが発生することがある。

その場合、最高性能を数ポイント上げることより、十分な成功率を保ったモデルを3倍近く多く試せることの方が、システム全体の成功率を高める場合がある。

ただし、Flashを単なる「安いPro」と考えるのも危険だ。

Terminal Bench 4.0では34.9対28.8、ExploitBenchでは47.9対25.3まで差が広がる。

タスクによってはモデル規模の差が明確に表れる。

実運用ではFlashを通常処理や大量の並列試行へ使い、難易度が高い、あるいは失敗コストの大きい仕事だけProへエスカレーションする構成が考えられる。

ただし、その判断は公開ベンチマークではなく、自社のツール、プロンプト、データ、harnessを使ったタスク単位の成功率で決める必要がある。

7,000超のRL環境を公開した意味

今回のリリースでもう一つ異例なのが、モデルの重みだけで終わらなかったことだ。

XiaomiはProとFlashに加え、技術報告、エンドツーエンドのRLフレームワーク、軽量なmini-harness、そして7,000件を超えるRL用タスク環境を公開した。

環境はソフトウェア開発、脆弱性再現、知識集約型作業、Webデザイン・開発などを対象とする。

RLフレームワークはverl、uni-agent、mini-swe-agentなどを基盤に、環境操作、軌跡収集、報酬評価、方策最適化までを扱う。

さらに、巨大なProやFlashを再学習できない研究者向けに「MiMo-V2.6-Distill-Qwen-9B」も用意した。

これはQwen3.5-9BをMiMoが生成したデータで教師あり微調整したモデルで、SFTデータは合計774億トークン、そのうち272億トークンが実際に損失計算へ使われるloss-bearing tokenだった。

Xiaomiはこの9Bモデルを出発点として公開RL環境で学習させた結果、報告したすべての指標でSFT版を上回ったとしている。

ベンチマーク SFT RL後 改善幅
SWE-bench Verified 61.1 66.2 +5.1
MiMo Cyber Bench 31.3 47.0 +15.7
Terminal Bench 2.1 37.1 52.8 +15.7
MiMo Visual Coding 64.0 72.4 +8.4
  • SFTのみ
  • RL後
MiMo-V2.6-Distill-Qwen-9Bに対するRLの効果横棒グラフ。カテゴリ 4 件、系列: SFTのみ, RL後(単位: スコア)SWE-bench VerifiedSWE-bench Verifie…SWE-bench Verified — SFTのみ: 61.1スコア61.1SWE-bench Verified — RL後: 66.2スコア66.2MiMo Cyber BenchMiMo Cyber BenchMiMo Cyber Bench — SFTのみ: 31.3スコア31.3MiMo Cyber Bench — RL後: 47スコア47Terminal Bench 2.1Terminal Bench 2.…Terminal Bench 2.1 — SFTのみ: 37.1スコア37.1Terminal Bench 2.1 — RL後: 52.8スコア52.8MiMo Visual CodingMiMo Visual Codin…MiMo Visual Coding — SFTのみ: 64スコア64MiMo Visual Coding — RL後: 72.4スコア72.4単位: スコア
データを表で見る
SFTのみ (スコア)RL後 (スコア)
SWE-bench Verified61.166.2
MiMo Cyber Bench31.347
Terminal Bench 2.137.152.8
MiMo Visual Coding6472.4
MiMo-V2.6-Distill-Qwen-9Bに対するRLの効果Xiaomiが公開した9Bモデルでの比較。公開RL環境を使った追加学習後、掲載された各評価でSFT版を上回った出典: Xiaomi MiMo-V2.6 technical report

ここに今回の公開の長期的な価値がある。

1.02兆パラメータのモデルを公開されても、数千枚規模のGPUを用意できない研究者は同じRLを再現できない。

しかし、9Bモデル、課題環境、採点器、harness、学習コードが同時に提供されれば、「複数のharnessを混ぜた学習は本当に未知の環境への適応を改善するのか」「groupwise gradingは別モデルでも効果があるのか」といった要素を、小さな計算規模で切り分けて検証できる。

Artificial Analysisの首位は、次のモデルが登場すれば失われる。

しかし、この訓練環境やRL手法が他の開発者に再利用されれば、MiMo-V2.6の影響はランキングより長く残る可能性がある。

「活性420億」だから420億パラメータモデルと同じ、ではない

オープンウェイトであることも、運用が容易という意味ではない。

Proは1トークンにつき420億パラメータしか活性化しないが、モデル全体には1.02兆パラメータが存在する。

推論時の演算量を考える上では活性パラメータ数が重要だが、モデルを保存し、expertをGPU間に配置する際には全体の重みを扱わなければならない。

Xiaomiの公式モデルカードで紹介されているPro向けSGLang構成も、16-way tensor parallelismとexpert parallelismを使い、複数GPU、複数ノードでの実行を想定している。

「活性420億」という数字だけを見て、420億パラメータ級の通常モデルと同じ感覚で1台のGPUへ載せられると考えてはいけない。

このため、多くの利用者にとって「オープンウェイト」は必ずしも「自社サーバーで動かした方が安い」という意味にならない。

API料金、GPU調達費、稼働率、キャッシュ率、レイテンシ、データ所在地、運用要員まで含めて比較する必要がある。

1トークンの価格ではなく「1タスクを成功させる費用」で比較する

MiMo-V2.6が示したもう一つの変化は、AIモデルの価格比較そのものだ。

100万トークン当たり0.14ドル0.435ドルかを見るだけでは、エージェントの経済性は分からない。

重要なのは、1つの仕事を完了するまでに何トークン使い、何回失敗し、何回やり直し、何秒かかるかである。

例えば安価なモデルでも、成功するまで3回やり直せば、高価だが1回で終わるモデルより高くなる場合がある。

一方、FlashのようにProとの差が小さい仕事では、単価差がそのまま大きなコスト差になる。

Artificial AnalysisがMiMo-V2.6-Proについて、100万トークン当たりの単価とは別に「Intelligence Indexの1タスク当たり0.13ドル」と算出しているのは、この違いを捉えるためだ。

同社の測定ではMiMo-V2.6-Proの出力速度も約130トークン/秒に達している。

今後エージェントモデルを選ぶ際には、

「どのモデルが最も賢いか」

だけではなく、

「成功したタスク1件当たり、いくらかかったか」

という指標の方が重要になっていくだろう。

MiMo-V2.6の本当の勝負はこれから始まる

MiMo-V2.6-ProのArtificial Analysis Intelligence Index「46」は分かりやすいニュースだ。

しかし、その数字だけなら寿命は短い。AIモデルのランキングは次の有力モデルが登場すれば塗り替えられる。

今回より重要なのは、Xiaomiが1モデルにつき約75万本もの長時間エージェント軌跡を生成し、ロールアウトだけでなくgraderにも大規模な計算資源を割き、異なる種類のタスクとharnessを一つのRLへ混ぜ、それを支える環境とコードまで公開したことである。

さらに商用利用では、Flashが多くの評価でProに近い性能を保ちながら、通常API料金を約3分の1まで下げている。

今後見るべき点は二つある。

一つは、Flashが実際の開発、調査、業務自動化などでProに近い「タスク成功率」を維持できるのか。

もう一つは、公開された9Bモデルと7,000超のRL環境を使い、Xiaomi以外の研究者が同じ方向の改善を再現できるのかだ。

そこまで確認されて初めて、MiMo-V2.6の6日間の大規模RLは「高性能な巨大モデルをもう一つ作った出来事」ではなく、エージェントをどう鍛えるかという工程そのものを外部へ渡した出来事だったと評価できる。

順位より、その方がはるかに長く残る可能性がある。