
テクノロジー
Google、H100で毎秒1,000トークン超を実現する拡散言語モデル「DiffusionGemma」をリリース
Google DeepMindが公開した拡散方式テキスト生成モデル「DiffusionGemma 26B」は、256トークンの一括処理によりGPUの並列演算能力を最大限に活用し、H100で1,000 tokens/sec超を達成。量子化時18GB VRAMで動作し、同サイズの自己回帰型Gemmaモデル比で最大4倍速いローカル推論向けの実験的オープンモデルだ。
LlamaやGemmaなどのモデルの学習速度を2倍から5倍に高め、メモリ使用量を大幅に削減する最適化技術を提供するライブラリ。

Google DeepMindが公開した拡散方式テキスト生成モデル「DiffusionGemma 26B」は、256トークンの一括処理によりGPUの並列演算能力を最大限に活用し、H100で1,000 tokens/sec超を達成。量子化時18GB VRAMで動作し、同サイズの自己回帰型Gemmaモデル比で最大4倍速いローカル推論向けの実験的オープンモデルだ。

Googleは、中規模のオープンモデル「Gemma 4 12B Unified」を公開した。単一のデコーダーのみで音声・画像・テキストを直接処理する設計が特徴であり、16GB程度のメモリを持つPCで高度なマルチモーダルエージェントを構築できる。

Googleは同社の軽量言語モデルファミリー「Gemma」の最新ラインナップとして、「FunctionGemma」をリリースした。 パラメータ数わずか2億7000万(270M)という、現代のLLM(大規模言語モデル)の基 […]