
OpenAIがSWE-Bench Pro推奨を撤回、公開課題の約30%を「壊れている」と推定
OpenAIはAIコーディング指標「SWE-Bench Pro」の約30%に欠陥があると発表し、推奨を撤回した。正解を不合格にする等の不備はモデルの正確な評価を妨げるため、今後は順位を競う前に採点器自体の継続的な監査が重要となる。(118文字)
Topic
AI Agents
全 650 件 / 55 ページ

OpenAIはAIコーディング指標「SWE-Bench Pro」の約30%に欠陥があると発表し、推奨を撤回した。正解を不合格にする等の不備はモデルの正確な評価を妨げるため、今後は順位を競う前に採点器自体の継続的な監査が重要となる。(118文字)

Metaは、コーディングや長時間のエージェント性能を大幅に強化した最上位AIモデル「Muse Spark 1.1」のAPIを公開した。重みを非公開とする戦略へ転換し、競合他社を大きく下回る低価格な従量課金制を打ち出すことで、開発者市場の獲得を狙う。

OpenAIは新モデルGPT-5.6を公開し、能力と価格帯が異なる3つのティアを展開した。単なる値下げではなく、推論量やエージェントの並列処理を制御する仕組みを導入しており、AIの評価軸をトークン単価から仕事を終える総費用へ転換させている。

MicrosoftはGo言語で再実装したTypeScript 7.0を公開し、型チェック等の処理速度を従来比で約8倍から12倍へと劇的に向上させた。本作は並列処理の最適化により大規模開発の効率を高める一方、既存APIとの互換性のために旧版との併用が推奨される。

核融合炉の燃料自給に不可欠な溶融塩中でのトリチウム生成を制御するため、量子コンピュータと古典計算を組み合わせた新手法が開発された。電子の複雑な挙動を高い精度でシミュレートすることで、腐食性化合物の形成予測や効率的な燃料回収の実現に挑む。

元GitHub CEOのThomas Dohmkeが興したEntireが分散型Gitネットワークをプレビュー公開。AIエージェントの大量アクセスがGitHubの限界を露呈させる中、性能数値の検証可能性とMicrosoft系投資家の関与が焦点になる。

Anthropicが2026年7月8日、最上位モデルFable 5を助言役に限定しSonnet 5に実行を委任する新パターンを発表した。公式クックブックの4ドルから1.61ドルへの実例と、BedrockやVertex非対応という制約を検証する。

AnthropicはAIエージェント「Claude Cowork」をクラウド実行に対応させ、PCが停止中でもスマホやWebから作業の継続や承認を可能にした。業務整理や資料作成での利用が多い実態に合わせ、場所を問わず仕事を預けられる設計へと進化した。

NVIDIAは次世代データセンターCPU「Rosa」に自社設計のRigelコアを採用し、AIエージェントの処理に不可欠な単一コア性能を向上させる。GPUの稼働率を左右するCPU側のデータ処理を高速化し、AI基盤全体の効率を高める狙いだ。

Tencentの推論モデルHy3はコーディングでGLM-5.2に譲り検索でGPT-5.5に肉薄する設計を選んだ。9日後に規制で退場する擬人化AIとの対比から、実務特化型AIエージェントが生き残る条件を読み解く。

GoogleのAmmaar Reshi氏が、最新AIのFable 5を活用し、2003年のPCゲームをiPhoneへ移植することに成功した。既存のコミュニティ資産とAIの高度な推論能力を組み合わせることで、複雑なレガシーコードの移行を短期間で実現した。

長大なテキストを画像化して読み込ませることで、LLMのトークン消費を大幅に抑えるツール「pxpipe」が登場した。画像面積で課金が決まるAPIの仕様を突き、精度低下のリスクを伴いつつも、開発コストを最大7割削減する新たな選択肢を提示している。