Term

Mixture of Experts

別名: MoE, Mixture of Experts, Mixture-of-Experts, 混合専門家モデル, 専門家混合, MoE++アーキテクチャ

Overview

最終更新: 2026年7月9日

Mixture of Experts(MoE)は、ニューラルネットワークにおいて全パラメータを一律に使うのではなく、複数の「専門家」と呼ばれるサブネットワークの中からゲーティング機構が入力ごとに一部だけを選択して計算する手法である。これにより、モデル全体が持つ総パラメータ数を大きく増やしても、実際に推論時に活性化される計算量(アクティブパラメータ)は限定されるため、性能と計算コストのトレードオフを改善できる。大規模言語モデル(LLM)の学習・推論効率化における主要なアーキテクチャ選択肢として、DeepSeek、Zhipu AI、Moonshot AI、Zyphraなど多くの開発企業が採用している。

概要

MoEの中心となるのはルーティング(ゲーティング)機構であり、入力トークンごとにどの専門家サブネットワークを活性化するかを決定する。典型的にはtop-kルーティングが用いられ、数十から数百存在する専門家のうち少数のみが実際の計算に使われる。この仕組みにより、密(dense)モデルでは同じ計算量で到達できない規模のパラメータ空間を確保しつつ、1トークンあたりの実効計算コストを密モデル並みに抑えることが可能になる。一方で、専門家間の負荷分散や学習の不安定さ、推論時のメモリ帯域・VRAM消費といった課題も残る。

技術的位置づけ

MoEは密モデルに対する代替アーキテクチャとして位置づけられる。密モデルはパラメータをすべて毎回使用するため計算コストが線形に増大するのに対し、MoEはパラメータ規模と計算コストを分離できる点が利点である。ただし全専門家分の重みをメモリ上に保持する必要があるため、総パラメータ数に応じたメモリ容量やVRAM帯域幅がボトルネックになりやすい。この制約は、投機的デコードによる推論高速化や、GPUメモリを補うストレージ活用技術など、周辺の推論最適化技術とセットで語られることが多い。

主要な動向

2026年5月にはDeepSeek-AIが、1.6兆パラメータのDeepSeek-V4-Proと2840億パラメータのDeepSeek-V4-Flashという2種のMoEモデルを含むDeepSeek-V4シリーズのプレビューを公開し、100万トークンのコンテキスト長と圧縮注意機構の組み合わせにより推論コストの削減を図った。同じ2026年に、中国のZhipu AIはMoE型の旗艦モデル「GLM-5」をオープンウェイトで発表し、商用モデルに匹敵するエージェント機能を低コストで実現したと位置づけた。また同社は軽量版シリーズ「GLM-4.7」も展開し、30B級モデルでの性能改善を進めた。2026年6月にはMoonshot AIが「Kimi K2.5」を発表し、多数のエージェントを並行動作させる仕組みと組み合わせたMoE構成で既存の商用モデルに接近する性能を示した。同時期には米ZyphraがAMD Instinct MI300のみで学習させた80億パラメータの推論特化モデル「ZAYA1-8B」を公開し、NVIDIA以外のハードウェアでもMoE系アーキテクチャの学習が実用段階にあることを示した。さらに2026年5月にはPhison Electronicsが「aiDAPTIV+」技術を拡張し、大規模MoEモデルを含む大きなモデルをコンシューマー向けPC上で動作させる取り組みを進めており、MoEモデルの巨大化とエッジ・ローカル環境での実行効率化という二つの方向性が並行して進んでいることがうかがえる。

Mentioned Articles

17 件

よくある質問

Mixture of Expertsとは何ですか?
モデル内の複数の専門家サブネットワークのうち一部だけを入力ごとに動的に選択して実行する手法である。パラメータ規模を増やしても実際の計算量は抑えられるため、性能とコストのバランスを改善できる。
Mixture of Expertsは密(dense)モデルと何が違いますか?
密モデルは毎回全パラメータを使うため計算量がパラメータ数に比例して増えるのに対し、MoEはルーティングにより一部の専門家のみを活性化するため、総パラメータ数を増やしつつ実効計算コストを抑えられる点が異なる。
どのようなAIモデルでMixture of Expertsが使われていますか?
DeepSeek-V4シリーズ、Zhipu AIのGLM-5・GLM-4.7、Moonshot AIのKimi K2.5、ZyphraのZAYA1-8Bなど、2026年に発表された多くの大規模言語モデルでMoEアーキテクチャが採用されている。
Mixture of Expertsモデルの運用には何が課題になりますか?
全専門家分の重みをメモリに保持する必要があるため、VRAM容量や帯域幅がボトルネックになりやすい。この課題に対し、投機的デコードやローカルストレージを活用した推論最適化技術が組み合わせて用いられている。
Mixture of Experts関連で2026年に注目された動きは何ですか?
2026年5月にDeepSeek-V4シリーズや軽量推論モデルZAYA1-8Bが公開され、2026年6月にはMoonshot AIのKimi K2.5が発表されるなど、大規模化と効率化の両方向でMoEモデルの発表が続いた。

External Mentions

10 件