
Kimi K3のサイバー攻撃力はなぜ米国の半分以下か、32%と76%が示す測定条件の差
英国AI安全保障研究所と米CAISIが2026年7月23日、Kimi K3のサイバー攻撃能力を評価。ExploitBenchで32%(米モデル平均は約76%)にとどまったが、測定条件の非対称性と発表タイミングが評価の読み方を複雑にしている。
Company
2021年設立、アメリカの企業。AI研究および大規模言語モデル「Claude」の開発を手がける。
全 385 件 / 33 ページ

英国AI安全保障研究所と米CAISIが2026年7月23日、Kimi K3のサイバー攻撃能力を評価。ExploitBenchで32%(米モデル平均は約76%)にとどまったが、測定条件の非対称性と発表タイミングが評価の読み方を複雑にしている。

NVIDIAのJensen Huang CEOが初のX投稿でオープンウェイトAI規制への反対を表明した書簡を支持。中国Kimi K3への警戒論の裏で、GPU需要拡大という自社利益との一致が浮かぶ。OpenAI、Anthropic、Googleは不参加。

Claude Opus 5はOpus 4.8と同じAPI基本単価でFable 5に迫る実務性能を示した。移行時は思考機能の既定化と未対応APIの確認が要る。

Alphabetは2026年7月22日発表のQ2決算で上場来初のフリーキャッシュフロー赤字(58億5500万ドル)を記録した。純利益1121億ドルの69%はSpaceXと非公開企業への評価益990億ドルの税引き後インパクトで、設備投資449億ドルが稼ぐ力を上回った内訳を分解する。

2026年の国際数学オリンピック上海大会において、複数のAIモデルが史上初めて全6問正解の満点を獲得した。言語処理から厳密な「機械的推論」へと進化したAIのアルゴリズムが、トップ1パーセントの人間の数学者と肩を並べ、科学研究の自動化に向けた新たな段階に入ったことを示している。

AnthropicがClaude音声モードの有料版にOpus/Sonnetを追加。接続ツール操作と日本語にも広がる一方、FreeはHaiku、Fableは対象外で、音声保持条件も未詳だ。

米政府がMoonshot AIによるFable蒸留とGB300利用を名指しで主張した。証拠は未公開で、7月27日のK3全重み公開と政府の具体策が次の判断材料となる。

米連邦地裁はAnthropicの15億ドル著作権和解を最終承認した。48万2,460作品の対象リストと44万490作品の有効請求を軸に、配分と残る法的争点を読み解く。

Moonshot AIのKimi K3が2026年7月、Arenaコーディング首位を獲得した裏で、米Cursorが旧版Kimiへの依存を当初公表していなかった過去が発覚。中国製AIを巡る疑惑と依存が数カ月で交錯した経緯を追う。

Google DeepMindのCEO Demis Hassabisが2026年7月14日、FINRA型の独立AI標準団体設立を提言した。6月に相次いだ政府による場当たり的なモデル停止を背景に、Amodei提唱のFAA型規制との主導権争いを解説する。

Anthropicの研究者は、AIモデルの内部に意識の有力理論であるグローバルワークスペース理論に類する情報処理空間を発見したと発表した。しかし、人間の脳との構造的差異や理論自体の不確実性から、これが直ちに意識の証明になるかは議論が分かれる。

Databricksの社内ベンチマークで、トークン単価が安いSonnet 5のタスク単価がOpus 4.8を上回る逆転現象が判明した。完了率とハーネス選定がコストを左右する構造をUberの予算超過事例とあわせて読み解く。