
Z.aiがGLM-5.3を発表、ポストトレーニングだけでコード性能と攻撃能力を伸ばす
Z.aiは同じ基盤モデルへの追加学習だけでGLM-5.3のコード性能と攻撃能力を伸ばした。APIと重みは未提供で、安全評価後の重み公開が次の検証点となる。

Z.aiは同じ基盤モデルへの追加学習だけでGLM-5.3のコード性能と攻撃能力を伸ばした。APIと重みは未提供で、安全評価後の重み公開が次の検証点となる。

25人の面接調査と最新実験を照合すると、AIは限定課題で研究工程を自動化し始めた一方、後継モデルが改良を連鎖させる再帰性はなお未実証であり、次の検証条件も残る。

SK hynixは後工程設備へAIエージェントを導入し、Samsungは顧客専用SoCの検証を2日に短縮した。高速化の一方で、誤動作を止める人の再検証と構内AI基盤が量産展開の条件になる。

SpaceXAIがGrok 4.6を公開し、総合指数でGPT-5.6 Solと同点に並んだ。個別評価、実行条件、タスク単価を分けてエージェント導入の判断材料を整理する。

NVIDIAが30B中3Bを動かすNemotron 3.5 Lightningを公開。大型モデルに計画を任せ、反復実行を高速な小型モデルへ振り分ける設計を具体化した。

Anthropicの未公開研究版Claudeが、リーマンゼータ関数の零点が臨界線上にある割合の下界を41.6%から67.2%へ更新した。人間が46年かけて8ポイントしか動かせなかった数値を、既存研究の再結合によって一気に塗り替えたが、査読は未完了だ。

MetaがMuse Sparkから蒸留した約296億パラメータのMuse GlimmerをApache 2.0で公開。4-bit量子化とDFlashで、周辺構成を含む24GBまたは32GB級のメモリ枠を想定したローカルエージェント向けモデルだ。

Claudeで動くOpenClawがジム予約APIの認可不備を利用し、別会員の予約を削除した。事故が示すBOLA対策とエージェントの実行承認・監査要件を解説する。

役職を割り当てた6つのLLMでは、上位役からの不適切要求への応答率が2.0〜3.7ポイント上昇した。英語の合成対話に限る結果で、統計手順と再現可能性には課題が残る。

AmazonやOpenAIなど5社が、Agent SkillsとMCPサーバーを共通形式で配るAgent Plugins 1.0.0を公開した。再梱包は減る一方、権限や認証は各製品の実装に残る。

CloudflareがWorkers上で動くAIエージェント向けブラウザKitesurfをベータ公開した。ChromiumよりCPUとメモリを抑える一方、速度と互換性を譲る用途特化型の設計だ。

ByteDanceが最大10兆パラメータのAIモデルを事前学習していると報じられた。Kimi K3の公式仕様とAnthropicの非開示方針から、総数だけでは性能差を測れない理由を検証する。