
AIに指示しても83%が忘れられる、コンテキスト圧縮という仕組みの落とし穴
ペンシルベニア州立大学の研究者が発表した論文「Lost in Compaction」は、AIのコンテキスト圧縮でユーザーの指示が平均83%消失することをCOMPINTベンチマークで実証した。Anthropic公式文書も自動的な指示保持を保証していない点を指摘する。
Topic
AI Agents
全 724 件 / 61 ページ

ペンシルベニア州立大学の研究者が発表した論文「Lost in Compaction」は、AIのコンテキスト圧縮でユーザーの指示が平均83%消失することをCOMPINTベンチマークで実証した。Anthropic公式文書も自動的な指示保持を保証していない点を指摘する。

玄鉄C950の64コア想定構成でQwen3.8-27Bを30 tokens/s以上で推論したとする資料を検証。性能を支えるSHL最適化と、未開示の測定条件、量産化までの距離を読み解く。

Gartnerは、AIエージェントの1ワークフロー当たり推論費が2028年までに5倍超へ増えると予測。単価ではなく成果1件当たりの費用管理が必要になる。

DeepSeekがAIエージェントのモデル層からUIまでを交換可能にする実行基盤を公開した。Cordisによる動的着脱と追記専用ログが、運用を固定製品から構成可能な部品へ移す。

Microsoft Entra IDは2027年2月に自社配信のSMS・音声MFAを終了し、パスキーを既定にする。企業は対象ユーザーの移行か顧客管理型通信事業者の設定を期限までに選ぶ必要がある。

GoogleはGemini 3.7 Flashを3.6公開から23日で投入。コード評価を伸ばし、年内は3.6リリース時の半額で提供するが、2027年1月には料金が倍になる。

SK hynixは後工程設備へAIエージェントを導入し、Samsungは顧客専用SoCの検証を2日に短縮した。高速化の一方で、誤動作を止める人の再検証と構内AI基盤が量産展開の条件になる。

NVIDIAのNeMo Switchyardは、管理評価で高価なLLMの呼び出しを絞り、費用を74%削減した。精度低下とpre-alphaという制約を踏まえ、企業導入の採算条件を検証する。

Deno Landは、Cloudflare Workers互換のコードを自前サーバーで動かすオープンソース基盤「celld」を公開した。各実行環境にSQLiteを統合し、S3互換ストレージを調整役に活用することで、分散環境での状態管理と高いコスト効率を実現する。(119文字)

Alibaba Cloudが開発したDualLaneは、定型案件を検証済みテンプレートで処理し、未知の案件のみLLMで計画を立てるAIエージェントである。この設計により、推論に伴う誤答や遅延を抑え、本番環境で高い精度と実行速度の両立を実現した。

NVIDIAが30B中3Bを動かすNemotron 3.5 Lightningを公開。大型モデルに計画を任せ、反復実行を高速な小型モデルへ振り分ける設計を具体化した。

MetaがMuse Sparkから蒸留した約296億パラメータのMuse GlimmerをApache 2.0で公開。4-bit量子化とDFlashで、周辺構成を含む24GBまたは32GB級のメモリ枠を想定したローカルエージェント向けモデルだ。