
DeepSeek V4.1 FlashがKVキャッシュを約4分の1に、長時間AI処理の費用を削る
DeepSeek V4.1 Flashは、入力と出力で計算量を分け、長い会話履歴の保存を軽量化した。性能比較の条件と公式料金から、AIエージェントの運用で効果が出る場面を読み解く。

GoogleはGemini 3.8 Flashを一般提供し、Cyber版を防御組織向けに限定した。Arenaの暫定値と公式ベンチマークを比較すると、低価格と用途別の強弱が同時に見える。

AlibabaはQwen4向け設計をQwen3.8-Flash-Nextで先行公開した。1760億相当の容量を持ちながら60億だけを活性化し、長文推論と訓練効率を再設計する。

匿名モデルOx AlphaはZ.aiのGLM-5.3-Flashだった。中国製AIチップ数万基での推論設計と、1日100兆トークンという容量主張の限界を解説する。

査読済みの10モデル実験は、AIエージェントの多数派追従が群サイズとモデルで変わると報告した。1,000体は複雑な協働能力ではなく、二択実験の上限値である。

MITの研究チームが、拡散モデルの出力を訓練データに帰属させることがデータ規模の増大に伴い不可能になる現象を実証した。著作権訴訟の立証基盤を揺るがす一方、モデルの大規模化自体が免責戦略になり得る逆説を突きつける。

Z.aiは同じ基盤モデルへの追加学習だけでGLM-5.3のコード性能と攻撃能力を伸ばした。APIと重みは未提供で、安全評価後の重み公開が次の検証点となる。

IIT BombayとAdobe ResearchのPTPは、Qwen環境でプロンプトの64.77%を完全復元した。GPT-4o転移では11.36%に落ち、適用範囲は限られる。

Alibaba Cloudが開発したDualLaneは、定型案件を検証済みテンプレートで処理し、未知の案件のみLLMで計画を立てるAIエージェントである。この設計により、推論に伴う誤答や遅延を抑え、本番環境で高い精度と実行速度の両立を実現した。

OpenAIがGPT-5.6 LunaのAPI料金を80%引き下げた。旧nano級へ戻った新単価を中国勢と比べると、入力比率と長文割増で最安モデルが入れ替わる。

アインシュタインの科学的発見を分析した論文によれば、LLMは帰納と演繹において高い能力を示す一方、身体的直感から新公理を導くアブダクションには構造的制約がある。データの圧縮や統計的処理だけでは、未知の概念を飛躍的に生むことは困難だ。

Alibabaは2.4兆パラメータのQwen3.8を予告したが、現在使えるのは月額制プレビューに限られる。Kimi K3との開示差から、性能順位とオープンウェイト化の未確定点を検証する。