
Meta、30B級Muse Glimmerを公開:RAM 24GB級で動かすローカルエージェント
MetaがMuse Sparkから蒸留した約296億パラメータのMuse GlimmerをApache 2.0で公開。4-bit量子化とDFlashで、周辺構成を含む24GBまたは32GB級のメモリ枠を想定したローカルエージェント向けモデルだ。
別名: llama.cpp
MetaのLlamaなどのモデルを、標準的なコンシューマー向けハードウェア(CPUやAppleシリコン等)で動作させることを目的としたオープンソースプロジェクト。量子化技術によりメモリ消費を大幅に削減できる。

MetaがMuse Sparkから蒸留した約296億パラメータのMuse GlimmerをApache 2.0で公開。4-bit量子化とDFlashで、周辺構成を含む24GBまたは32GB級のメモリ枠を想定したローカルエージェント向けモデルだ。

Googleは、中規模のオープンモデル「Gemma 4 12B Unified」を公開した。単一のデコーダーのみで音声・画像・テキストを直接処理する設計が特徴であり、16GB程度のメモリを持つPCで高度なマルチモーダルエージェントを構築できる。

Googleは、Gemma 4の推論を最大3倍高速化するMulti-Token Prediction対応ドラフトモデルを公開した。このモデルは、投機的デコード技術によりトークン生成と検証を分離し、VRAM帯域幅のボトルネックを解消することで、エッジデバイスやローカルPCでの推論品質を低下させることなく大幅に改善する。

Googleは同社の軽量言語モデルファミリー「Gemma」の最新ラインナップとして、「FunctionGemma」をリリースした。 パラメータ数わずか2億7000万(270M)という、現代のLLM(大規模言語モデル)の基 […]

Microsoftが先日発表した「Copilot+ PC」は、発表当初QualcommのSnapdragon Xチップを搭載したノートPCしかラインナップされていなかったが、NVIDIAの本日の発表によればQualcom […]