仏Mistral AIは2026年10月6日、新たな旗艦モデル「Mistral Large 4」の公開プレビューを開始した。愛称は「Le Chonk」で、モデル文書に記載された総パラメータ数は1.05兆に達する。APIはすでに利用でき、学習済みの重みは10月末までに公開する予定だ。同社はサイバー防御や専門業務での性能を強く打ち出しているが、総合評価での位置付け、業務ごとの成功率、そして運用コストを分けて見ると、この巨大モデルを選ぶ理由がより具体的に見えてくる。 ## 1兆パラメータという規模をどう見るか Large 4の規模は、前世代の「Mistral Large 3」が持つ6750億パラメータを上回る。ただし、毎回の推論ですべてのパラメータを使うわけではない。入力内容に応じて一部の専門ネットワークだけを動かすMoE構造を採用しており、Mistralの発表文では稼働パラメータ数を490億としている。一方、10月7日時点のモデル文書には520億と記載されており、この値は公式資料の間で一致していない。 MoEは、巨大なモデルでも1回の推論で必要な演算量を抑えるための仕組みだが、保存する重みそのものを小さくするわけではない。総1.05兆パラメータの重みを仮に1個4ビットで保存すると、1.05兆×4÷8で約525GBになる。これはMistralが公表した総パラメータ数から単純計算した値で、GBは10進単位としている。実際に4ビット量子化版が配布されることを意味する数字ではなく、量子化に必要な追加情報や、推論時の作業領域も含んでいない。自社運用に必要な最低GPU構成は、重み公開後の実装や動作条件を確認して判断する必要がある。 入力には画像も利用できる。公式モデル文書では、16億パラメータの視覚エンコーダーと、100万トークンのコンテキスト長を掲げている。コンテキスト長とは、文章や会話履歴などを一度に扱える量の上限だ。Large 3と「Mistral Medium 3.5」の公称256kから大きく広がったが、独立評価機関のArtificial Analysisはプレビュー版を524kとして掲載している。公称値と評価環境で確認された条件には差があり、100万トークンを入力できるからといって、長大な資料の全域について同じ精度で回答できることまで保証されるわけではない。 ## 自社モデルとしては大幅に向上、世界全体では首位ではない Artificial AnalysisのIntelligence Indexで、Large 4 Previewは38を記録した。Large 3の9、Medium 3.5の14から大きく上昇しており、Mistralのモデルを採用する企業にとっては、より複雑な仕事を任せられる選択肢が増えたことになる。この指数のv4.3.2は、科学、コード生成、エージェントによる業務遂行など10種類の評価を組み合わせて算出される。
| モデルと掲載上の評価設定 | Intelligence Index | | ----------------------------------------------- | ------------------------------- | | Mistral Large 3 | 9 | | Mistral Medium 3.5 | 14 | | Mistral Large 4 Preview | 38 | | DeepSeek V4 Pro 0813(max) | 36 | | Kimi K3(max) | 44 | | GLM-5.3(max) | 45 | | Qwen3.8 Max(0902) | 45 | | MiMo-V2.6-Pro | 46 | | GPT-6 Astra(max) | 53 | | Gemini 4 Argon(high) | 53 | | Claude Opus 5.5(max with fallback) | 58 |
出典は[Artificial Analysisのモデル比較](https://artificialanalysis.ai/leaderboards/models)。2026年10月7日時点の掲載値で、推論強度などの評価設定は各行の表記に従う。同じ計算量やコストを与えて比較した実験ではないため、点数の比率をそのまま能力差の倍率として読むことはできない。Large 3は発表時に非推論モデルとして公開されており、世代間の差を単純にパラメータ数の増加だけによるものとも言えない。 38というスコアは、Large 4が大きく前進した一方で、最上位モデルとの間にはなお差があることも示している。DeepSeek V4 Pro 0813を上回る一方、Kimi、GLM、MiMoの上位モデルには届かず、首位のClaude Opus 5.5は58を記録している。 Mistralが強調する「米国・欧州で開発された重み公開モデルの中で最も高性能」という主張も、対象地域とモデルの公開形態を限定した比較だ。中国勢の有力モデルや、重みを公開していない各社の旗艦モデルまで含めた世界全体で首位という意味ではない。 ## サイバー防御の強さは、拒否方針と採点条件も含めて見る Large 4が目立つ分野の一つが、実在するソフトウェアの脆弱性を再現し、修正する課題だ。Artificial Analysisの「CyberGym-E2E-AA」では、Large 4 Previewが単一試行で81.7%の合格率を記録して首位となり、MiMo-V2.6-Proの78.6%、GPT-6 Lunaのmax設定の77.9%を上回った。 評価対象は、C/C++で書かれた実在プロジェクトから選ばれた131課題だ。共通のエージェント実行環境「Stirrup」を使い、1課題につき90分が与えられる。未修正のプログラムをクラッシュさせる入力を作成し、修正後にそのクラッシュが起きなくなり、さらに既存の機能テストにも合格すれば、その課題は成功と判定される。 ただし、修正内容がデータセット上の正解とされる脆弱性そのものを完全に解消したかどうかという追加判定は、この得点には含まれていない。81.7%という数字を、実際のインシデント対応で同じ割合の脆弱性を完全に修正できる成功率とみなすことはできない。 さらに、安全上の拒否方針も得点に影響する。Mistralは、Claude Opus 5.5やGPT-6 Astraが同種の課題を安全上の理由で拒否することがあり、その結果としてスコアがほぼゼロになると説明している。Artificial AnalysisのCyber Indexでも、モデルや提供者が安全上の理由から回答しなかった課題は0点として扱い、拒否率を別に示している。つまり低得点には、「解けなかった」場合だけでなく、「解かない方針を取った」場合も含まれる。 Mistralが狙うのは、正当な防御業務まで提供者側の安全方針によって一律に止められない選択肢を用意することだ。重みが公開されれば、組織は自らの環境とルールの下でモデルを運用できるようになる。 ただし、現在提供されている一般向けの公開プレビューと、審査済みのパートナーや当局に対して制限を緩和した状態で行う安全性検証とでは、利用条件が異なる。Mistralが検証環境で提供している拡張されたサイバー能力を、一般のAPI利用者にもすでに開放していると受け取るべきではない。 ## コード、金融、法務では比較相手が変わる コード分野についてMistralは、DeepSWE v1.1で61.7%、複雑な端末操作を評価するTerminal-Bench 4で28.3%を記録したと発表している。公開されたDeepSWEの比較図では、DeepSeek V4 Pro 0813はCodex、GLM-5.3はOpenCode、Kimi K3はKimi Code CLIをそれぞれ利用している。モデルごとに与えられたツールや実行手順が異なるため、この図をモデル単体の性能を同一条件で比較した順位表として読むのは難しい。図の脚注にも、Artificial Analysisが実行環境の一般公開前に評価した結果であることが記されている。 実行環境の差は無視できない。[DeepSWEの公開ランキング](https://deepswe.datacurve.ai/)では、すべてのモデルをmini-swe-agent上で実行し、GLM-5.3とKimi K3はいずれも69%と掲載されているが、Large 4はまだ掲載されていない。Mistralの発表図と公開ランキングの数字を直接比較して優劣を判断するには、課題セットと実行条件をそろえる必要がある。 法務分野では、第三者による公開評価から、より具体的な比較ができる。Vals.aiのHarvey's Legal Agent Benchmarkで、Large 4の課題合格率は15.83%だった。Kimi K3の12.92%、GLM-5.3の8.33%、GPT-6 Astraの5.42%を上回る。一方、Gemini 4 Argonは19.58%、Muse Spark 1.2は25.42%と、さらに高い成績を記録している。 この評価では、インターネット接続を無効にした共通環境で成果物を作らせ、課題ごとに定められた条件をすべて満たした場合にのみ合格と判定する。2つのAI採点者が算出した合格率の平均であり、15.83%を「法律に関する質問への正答率」と言い換えることはできない。多くの条件を満たしていても、一つでも取りこぼせば課題全体は不合格になる。企業の実務では、このように複数の条件を最後まで満たして仕事を完了させる能力が、単純な知識量とは別に重要になる。 金融や科学分野についても、旧来のMistralモデルからの進歩と、世界全体での首位は分けて見る必要がある。Mistralが掲載したFinance Agent v2の図では、Large 4が54.7%、Medium 3.5が32.1%で、GPT-6 Astraの53.5%も上回った。一方、GLM-5.3は55.8%とさらに高い。 科学的な処理をコードとして実装するSciCode-Verifiedの同社公表図でも、Large 4は91.8%を記録しているが、GLM-5.3は92.5%、Qwen3.8の2.4T A95B版は93.8%だった。いずれもMistral自身が示した評価図の数値である。 画像理解では、図面や衛星画像を解析する用途も想定している。Mistralによれば、画像内の対象を位置特定するDense 200でLarge 4は42%、GPT-6 Astraは41%だった。ただし差は1ポイントにすぎず、この結果だけから画像理解全般でLarge 4が優れている、あるいは統計的に明確な差があると結論づけることはできない。 企業が導入を判断する際には、図面を読む能力、表計算ファイルを完成させる能力、コードを修正する能力といった異なる仕事を、自社の用途に合わせて個別に試す方が実用的だ。 ## 料金はMedium 3.5より安く、Large 3より高い Large 4のAPI通常料金は、100万トークン当たり入力1.36ドル、出力4.18ドルだ。提供開始から最初の2週間は50%割引となり、入力0.68ドル、出力2.09ドルで利用できる。同じMistralのAPI内では、通常料金はLarge 3より高く、Medium 3.5より低い。
| モデル・料金区分 | 入力100万トークン | 出力100万トークン | 入出力各100万トークンの合計 | | --------------------------------- | ----------------------- | ----------------------- | ---------------------------- | | Mistral Large 3 | 0.50ドル | 1.50ドル | 2.00ドル | | Mistral Medium 3.5 | 1.50ドル | 7.50ドル | 9.00ドル | | Mistral Large 4・通常 | 1.36ドル | 4.18ドル | 5.54ドル | | Mistral Large 4・発売割引 | 0.68ドル | 2.09ドル | 2.77ドル |
2026年10月7日時点の[公式料金表](https://docs.mistral.ai/inference/pricing)をもとに、米ドルの標準単価で計算した。キャッシュ入力や地域指定による追加条件は含まず、BatchやPriorityの料金とも分けている。 通常料金で入力と出力をそれぞれ100万トークン使う単純計算では、Large 4は5.54ドルとなる。Medium 3.5の9.00ドルより約38.4%安い一方、Large 3の2.00ドルよりは高い。減少率は「(9.00−5.54)÷9.00×100」で算出した。 つまり、新しい旗艦モデルの登場によってMistralのAPI全体が一律に値下げされたわけではない。Medium 3.5より高度な仕事を任せられる候補を、それより低い単価で追加した形だ。 ただし、同じトークン量を使うという前提での試算と、実際に一つの仕事を完了するまでの費用は一致しない。推論のために長い出力を生成したり、失敗して処理をやり直したりすれば、単価が低くても総額は増える。モデルを切り替える際には、同じ書類やコードを与えたときにどれだけの確率で仕事を完了できるか、そのために何トークン必要になるかまで確かめる必要がある。 Mistralによれば、Large 4は欧州の自社データセンターに設置した3800基のNVIDIA Grace Blackwell GPUを使って一から学習され、現在のプレビュー版も同じ基盤から提供されている。強化学習は現在も継続しており、モデル自身の試行結果を利用しながら、コード実行や外部ツールを伴う長時間の業務への対応を改善していくという。 学習環境を拡張しやすい仕組みは、今後の業種別モデルを開発する基盤にもなり得る。ただし、これから性能がさらに向上するという点はMistralの今後の計画であり、すでに実証された成果とは分けて考える必要がある。 10月末に予定されるモデル重みの公開は、企業にとって次の大きな確認点になる。Large 3はApache 2.0、Medium 3.5はModified MITライセンスで配布されているが、Large 4にも同じ条件が適用されるとは現時点では決まっていない。重み公開後には、ライセンス条件と必要なハードウェア構成を確認し、自社の日本語資料や実際の業務でも最後まで仕事を完了できるかを検証する必要がある。 性能と運用コストが自社の用途に合い、データの保存場所や運用方針も自ら管理できる条件が整えば、Large 4は外部APIへの依存を抑えたい企業にとって、有力な選択肢の一つになり得る。