
Google、H100で毎秒1,000トークン超を実現する拡散言語モデル「DiffusionGemma」をリリース
Google DeepMindが公開した拡散方式テキスト生成モデル「DiffusionGemma 26B」は、256トークンの一括処理によりGPUの並列演算能力を最大限に活用し、H100で1,000 tokens/sec超を達成。量子化時18GB VRAMで動作し、同サイズの自己回帰型Gemmaモデル比で最大4倍速いローカル推論向けの実験的オープンモデルだ。
別名: Diffusion Model, Diffusion Models, 拡散モデル
拡散モデル(Diffusion Model)とは、ランダムなノイズを段階的に除去していく過程を学習することで、画像やテキスト、音声などのデータを生成する機械学習アーキテクチャである。学習データにノイズを付加する順方向過程と、ノイズを除去して元のデータ構造を復元する逆方向過程の2つのプロセスから構成される。Stable DiffusionやMidjourneyなど画像生成AIの中核技術として広く採用されてきたが、近年はテキスト生成分野への応用も進んでいる。
拡散モデルは、学習データに徐々にガウスノイズを加えていく過程(拡散過程)と、そのノイズを段階的に除去してデータを再構成する過程(逆拡散過程)をニューラルネットワークに学習させることで機能する。生成時には純粋なノイズから出発し、学習済みのモデルが繰り返しノイズ除去を行うことで最終的に高品質な出力を得る。この仕組みにより、敵対的生成ネットワーク(GAN)などと比較して学習の安定性が高く、多様で高解像度な画像生成が可能になる点が特徴とされる。
従来、拡散モデルは主に画像・動画・音声などの連続的なデータ生成に用いられ、テキスト生成分野では単語やトークンを一つずつ順番に生成する自己回帰型の大規模言語モデル(LLM)が主流であった。しかし拡散モデルは一括で複数トークンを並列的に処理できるため、GPUの並列演算能力を活かした高速推論が可能になるという利点があり、近年はテキスト生成への応用が研究の焦点となっている。また画像生成領域では、拡散モデルに代わる新たなアプローチとして正規化フロー系の技術を模索する動きも見られる。
2026年4月には、米スタンフォード大学教授Stefano Ermonらが設立したInception Labsが、拡散型LLM「Mercury」を発表し、従来の自己回帰型LLMと比較して最大10倍高速なテキスト生成が可能であると報告した。同時期にはAppleが、拡散モデルに匹敵する高解像度画像生成技術「STARFlow」を発表し、Stable DiffusionやMidjourneyとは異なるアプローチを模索する動きも示した。
2026年6月には、Google DeepMindが拡散方式のテキスト生成モデル「Gemini Diffusion」を発表し、続けて「DiffusionGemma 26B」を公開した。DiffusionGemma 26Bは256トークンを一括処理する方式によりGPUの並列演算能力を最大限に活用し、H100で毎秒1,000トークンを超える生成速度を達成、量子化時には18GB VRAMで動作するとされ、同サイズの自己回帰型Gemmaモデルと比較して最大4倍の高速化を実現した実験的オープンモデルとして公開された。
これらの動きは、拡散モデルが画像・動画生成の領域を超えて、テキスト生成やコード生成といった分野へも拡張されつつあることを示している。生成速度と計算効率の両立を目指す技術として、拡散モデルは自己回帰型モデルに代わる、あるいは補完する選択肢として注目を集めている。

Google DeepMindが公開した拡散方式テキスト生成モデル「DiffusionGemma 26B」は、256トークンの一括処理によりGPUの並列演算能力を最大限に活用し、H100で1,000 tokens/sec超を達成。量子化時18GB VRAMで動作し、同サイズの自己回帰型Gemmaモデル比で最大4倍速いローカル推論向けの実験的オープンモデルだ。

MicrosoftのMAI-Image-2.5が、ユーザー評価に基づくArena text-to-imageリーダーボードで3位を獲得した。これは、テキストレンダリング、スタイル付きイラスト、商業用画像の品質を大幅に向上させ、特にテキスト精度は商業利用の障壁を打ち破る可能性を秘めている。OpenAIが独占してきたトップ圏にMicrosoftが食い込み、エンタープライズ向けAzure統合により実務でのAI画像生成活用を加速させるだろう。

人工知能の急速な進化は、人類に多大な恩恵をもたらしている一方で、地球規模の深刻な課題を突きつけている。それは、天文学的な規模に膨れ上がる計算リソースとそれに伴う電力消費の激増だ。国際エネルギー機関(IEA)の推計によると […]
Google Pixel 10 Proの目玉機能「超解像ズーム Pro(Pro Res Zoom)」が、発表直後から世界中のメディアとユーザーを巻き込み、激しい賛否両論の渦中にある。生成AIを駆使し、最大100倍という驚 […]

Appleが、AI分野における同社の技術的停滞への批判に対する反論だろうか。この度、静かに公開された技術論文で、同社の研究チームは「STARFlow」と名付けられた新たな高解像度画像生成AIモデルを発表した。このモデルは […]

Google DeepMindは、AIによるテキスト生成に革新をもたらす新たな研究モデル「Gemini Diffusion」を発表した。画像や動画生成で目覚ましい成果を上げてきた「拡散モデル(Diffusion Mode […]

米スタンフォード大学教授Stefano Ermonらが設立したInception Labsは、従来の大規模言語モデル(LLM)より最大10倍高速なテキスト生成が可能な拡散型LLM「Mercury」を発表した。同社の最初の […]

Microsoftは、人工知能(AI)を活用して未知の材料を設計・生成できる画期的なAIシステム「MatterGen」を開発したと発表した。このシステムは、より効率的なバッテリーや太陽電池、その他の重要な技術開発を加速す […]

天気予報の常識を覆す革新的な進展が報告された。Google DeepMindは、新しいAI天気予報モデル「GenCast」を発表した。学術誌『Nature』に掲載された研究によると、GenCastは現在世界最高精度とされ […]

Googleとテルアビブ大学の研究チームが発表したAIモデル「GameNGen」は、ゲーム開発の常識を覆す物となるかもしれない。この新しい“ニューラルモデル”のみで動作する初のゲームエンジンは、1993年に発売された伝説 […]

これまでもディープフェイクの一例として、名画のデータと、フェイストラッキング等を組み合わせて、例えばモナリザを動かすような技術は存在したが、今回Microsoftの研究者らが発表した「VASA-1」と呼ばれるフレームワー […]

昨年のMidjourneyやStable Diffusion等の画像生成AIから始まり、ChatGPTの登場によって決定的となった生成AI(人工知能による自動生成技術)が急速に注目されている。この技術を用いれば、テキスト […]