Term

拡散モデル

別名: Diffusion Model, Diffusion Models, 拡散モデル

Overview

最終更新: 2026年7月9日

拡散モデル(Diffusion Model)とは、ランダムなノイズを段階的に除去していく過程を学習することで、画像やテキスト、音声などのデータを生成する機械学習アーキテクチャである。学習データにノイズを付加する順方向過程と、ノイズを除去して元のデータ構造を復元する逆方向過程の2つのプロセスから構成される。Stable DiffusionやMidjourneyなど画像生成AIの中核技術として広く採用されてきたが、近年はテキスト生成分野への応用も進んでいる。

概要

拡散モデルは、学習データに徐々にガウスノイズを加えていく過程(拡散過程)と、そのノイズを段階的に除去してデータを再構成する過程(逆拡散過程)をニューラルネットワークに学習させることで機能する。生成時には純粋なノイズから出発し、学習済みのモデルが繰り返しノイズ除去を行うことで最終的に高品質な出力を得る。この仕組みにより、敵対的生成ネットワーク(GAN)などと比較して学習の安定性が高く、多様で高解像度な画像生成が可能になる点が特徴とされる。

技術的位置づけ

従来、拡散モデルは主に画像・動画・音声などの連続的なデータ生成に用いられ、テキスト生成分野では単語やトークンを一つずつ順番に生成する自己回帰型の大規模言語モデル(LLM)が主流であった。しかし拡散モデルは一括で複数トークンを並列的に処理できるため、GPUの並列演算能力を活かした高速推論が可能になるという利点があり、近年はテキスト生成への応用が研究の焦点となっている。また画像生成領域では、拡散モデルに代わる新たなアプローチとして正規化フロー系の技術を模索する動きも見られる。

主要な動向

2026年4月には、米スタンフォード大学教授Stefano Ermonらが設立したInception Labsが、拡散型LLM「Mercury」を発表し、従来の自己回帰型LLMと比較して最大10倍高速なテキスト生成が可能であると報告した。同時期にはAppleが、拡散モデルに匹敵する高解像度画像生成技術「STARFlow」を発表し、Stable DiffusionやMidjourneyとは異なるアプローチを模索する動きも示した。
2026年6月には、Google DeepMindが拡散方式のテキスト生成モデル「Gemini Diffusion」を発表し、続けて「DiffusionGemma 26B」を公開した。DiffusionGemma 26Bは256トークンを一括処理する方式によりGPUの並列演算能力を最大限に活用し、H100で毎秒1,000トークンを超える生成速度を達成、量子化時には18GB VRAMで動作するとされ、同サイズの自己回帰型Gemmaモデルと比較して最大4倍の高速化を実現した実験的オープンモデルとして公開された。
これらの動きは、拡散モデルが画像・動画生成の領域を超えて、テキスト生成やコード生成といった分野へも拡張されつつあることを示している。生成速度と計算効率の両立を目指す技術として、拡散モデルは自己回帰型モデルに代わる、あるいは補完する選択肢として注目を集めている。

Mentioned Articles

12 件

よくある質問

拡散モデルとは何ですか?
ノイズを段階的に除去していく過程を学習することで、画像やテキスト、音声などのデータを生成する機械学習アーキテクチャである。ノイズを加える順方向過程と除去する逆方向過程から構成される。
拡散モデルと自己回帰型モデルの違いは何ですか?
自己回帰型モデルはトークンを一つずつ順番に生成するのに対し、拡散モデルは複数トークンを一括で並列処理できるため、GPUの並列演算能力を活かした高速な生成が可能とされる。
拡散モデルはどのような分野で使われていますか?
従来は画像・動画・音声生成が主な用途であったが、近年はテキスト生成やコード生成といった分野にも応用が広がっている。
2026年の拡散モデルに関する主要な発表は何ですか?
2026年4月にInception Labsが拡散型LLM「Mercury」を、Appleが画像生成技術「STARFlow」を発表した。同年6月にはGoogle DeepMindが「Gemini Diffusion」と「DiffusionGemma 26B」を公開した。