
Copilotに中国Kimi K3採用案、Microsoftが狙う推論費6億ドル削減
MicrosoftがKimi K3のAzure提供とCopilot採用を評価していると報じられた。最大6億ドル削減の成否は、品質を保ったまま処理を振り分けられる割合で決まる。
別名: MoE, Mixture of Experts, Mixture-of-Experts, 混合専門家モデル, 専門家混合, MoE++アーキテクチャ
Mixture of Experts(MoE)は、ニューラルネットワークにおいて全パラメータを一律に使うのではなく、複数の「専門家」と呼ばれるサブネットワークの中からゲーティング機構が入力ごとに一部だけを選択して計算する手法である。これにより、モデル全体が持つ総パラメータ数を大きく増やしても、実際に推論時に活性化される計算量(アクティブパラメータ)は限定されるため、性能と計算コストのトレードオフを改善できる。大規模言語モデル(LLM)の学習・推論効率化における主要なアーキテクチャ選択肢として、DeepSeek、Zhipu AI、Moonshot AI、Zyphraなど多くの開発企業が採用している。
MoEの中心となるのはルーティング(ゲーティング)機構であり、入力トークンごとにどの専門家サブネットワークを活性化するかを決定する。典型的にはtop-kルーティングが用いられ、数十から数百存在する専門家のうち少数のみが実際の計算に使われる。この仕組みにより、密(dense)モデルでは同じ計算量で到達できない規模のパラメータ空間を確保しつつ、1トークンあたりの実効計算コストを密モデル並みに抑えることが可能になる。一方で、専門家間の負荷分散や学習の不安定さ、推論時のメモリ帯域・VRAM消費といった課題も残る。
MoEは密モデルに対する代替アーキテクチャとして位置づけられる。密モデルはパラメータをすべて毎回使用するため計算コストが線形に増大するのに対し、MoEはパラメータ規模と計算コストを分離できる点が利点である。ただし全専門家分の重みをメモリ上に保持する必要があるため、総パラメータ数に応じたメモリ容量やVRAM帯域幅がボトルネックになりやすい。この制約は、投機的デコードによる推論高速化や、GPUメモリを補うストレージ活用技術など、周辺の推論最適化技術とセットで語られることが多い。
2026年5月にはDeepSeek-AIが、1.6兆パラメータのDeepSeek-V4-Proと2840億パラメータのDeepSeek-V4-Flashという2種のMoEモデルを含むDeepSeek-V4シリーズのプレビューを公開し、100万トークンのコンテキスト長と圧縮注意機構の組み合わせにより推論コストの削減を図った。同じ2026年に、中国のZhipu AIはMoE型の旗艦モデル「GLM-5」をオープンウェイトで発表し、商用モデルに匹敵するエージェント機能を低コストで実現したと位置づけた。また同社は軽量版シリーズ「GLM-4.7」も展開し、30B級モデルでの性能改善を進めた。2026年6月にはMoonshot AIが「Kimi K2.5」を発表し、多数のエージェントを並行動作させる仕組みと組み合わせたMoE構成で既存の商用モデルに接近する性能を示した。同時期には米ZyphraがAMD Instinct MI300のみで学習させた80億パラメータの推論特化モデル「ZAYA1-8B」を公開し、NVIDIA以外のハードウェアでもMoE系アーキテクチャの学習が実用段階にあることを示した。さらに2026年5月にはPhison Electronicsが「aiDAPTIV+」技術を拡張し、大規模MoEモデルを含む大きなモデルをコンシューマー向けPC上で動作させる取り組みを進めており、MoEモデルの巨大化とエッジ・ローカル環境での実行効率化という二つの方向性が並行して進んでいることがうかがえる。

MicrosoftがKimi K3のAzure提供とCopilot採用を評価していると報じられた。最大6億ドル削減の成否は、品質を保ったまま処理を振り分けられる割合で決まる。

MoonshotはKimi K3への需要増で新規契約を止め、既存会員を優先する。今後はWeb・アプリ・Work向けとコーディング向けに会員制度を分け、GPU容量の配分を見直す。

米Zyphraは、AMD Instinct MI300のみでフルスタック学習させた80億パラメータの推論モデル「ZAYA1-8B」を公開した。独自のアーキテクチャと推論時計算手法「Markovian RSA」により、大手モデルに匹敵する数理・コーディング性能を達成し、Apache 2.0ライセンスで商用利用を促進する。

Googleは、Gemma 4の推論を最大3倍高速化するMulti-Token Prediction対応ドラフトモデルを公開した。このモデルは、投機的デコード技術によりトークン生成と検証を分離し、VRAM帯域幅のボトルネックを解消することで、エッジデバイスやローカルPCでの推論品質を低下させることなく大幅に改善する。

DeepSeek-AIは、100万トークンのコンテキスト長を持つDeepSeek-V4シリーズのプレビュー版を公開した。DeepSeek-V4-ProとDeepSeek-V4-Flashは、それぞれ1.6兆と2840億のパラメータを持つMixture-of-Expertsモデルであり、長文推論のコスト効率を大幅に改善した。特に、Compressed Sparse AttentionとHeavily Compressed Attentionを組み合わせたハイブリッド注意機構により、1トークン推論FLOPsとKVキャッシュを大幅に削減し、大規模言語モデルの運用コスト低減に貢献する。

OpenAIは、テキスト中の個人識別情報(PII)をローカルで検出・マスクする「OpenAI Privacy Filter」を公開した。Apache 2.0ライセンスで提供され、クラウドに送る前のデータ処理に活用できるが、匿名化ツールや法令順守の証明にはならないため、高リスク用途での利用には注意が必要だ。

2026年2月11日、北京。中国のAIスタートアップの筆頭格であるZhipu AI(智譜AI、旧称:Knowledge Atlas Technology)は、最新の旗艦基盤モデル「GLM-5」を発表した。春節(旧正月)を […]

2026年1月、AI業界にまたしても中国からの巨大な波が押し寄せた。AlibabaやHongShan(旧Sequoia China)から巨額の支援を受けるMoonshot AI(月之暗面)が、最新のオープンソースモデル「 […]

2026年1月20日、中国の有力AI企業であるZhipu AI(Z.ai)は、オープンソースとオープンサイエンスの精神を掲げ、既に発表していた新たな言語モデルシリーズ「GLM-4.7」に続き、その軽量版である「GLM-4 […]

2026年1月、ラスベガスで開催されたCES 2026において、Phison Electronicsは、「aiDAPTIV+」テクノロジーの拡張版を発表した。同社はこれにより、高価なGPUメモリ(VRAM)の限界という、 […]

中国のAIスタートアップMoonshot AIが発表したオープンソースモデル「Kimi K2 Thinking」が、主要な性能ベンチマークでOpenAIのGPT-5やAnthropicのClaude Sonnet 4.5 […]

テクノロジー業界の勢力図を塗り替えかねない、重大な提携が最終局面を迎えている。長年、音声アシスタントの性能で後塵を拝してきたAppleが、Siriの全面的な機能刷新に向け、最大のライバルであるGoogleの生成AIモデル […]

OpenAIは2025年8月5日、「gpt-oss-120b」と「gpt-oss-20b」という2つのオープンウェイトモデルを同時に公開した。これは、2019年のGPT-2以来となるオープンソースへの回帰である。プロプラ […]

中国のAIスタートアップ、Moonshot AIが発表したオープンソースモデル「Kimi K2」がAI業界に波紋を広げそうだ。これは単なる高性能な大規模言語モデル(LLM)の登場ではなく、AI開発の根底に横たわる「経済学 […]

Googleは、同社が「推論の時代」と呼ぶ新たなフェーズに向けた最新AIアクセラレータ「Ironwood」を発表した。第7世代となるこのTensor Processing Unit (TPU)は、Google史上初めて推 […]

中国の新興AIスタートアップDeepSeekが、人工知能の歴史に新たな一章を刻む革新的な言語モデル「DeepSeek-R1」を発表した。このモデルは、業界最高峰とされるOpenAIの「o1」と同等の性能を持ちながら、驚異 […]

中国のAIスタートアップ「SenseTime」社は、マルチモーダル大規模言語モデル(LLM)の「SenseNova 5.0」を発表した。これまであまり名前を聞いたことのないこの企業は、今回ある主張によって一挙に注目を集め […]