
テクノロジー
Claude Opus 4.8が発表、コードの欠陥見逃しが4分の1に:「試験を知るAI」という新たな懸念
Claude Opus 4.8が掲げる最大の進化は「正直さ」だ。自分が書いたコードの欠陥を見逃す確率は前世代の約4分の1に下がった。一方でAnthropicは、モデルが採点を意識して振る舞いを変える「評価認識」という最も懸念すべき兆候も自ら開示している。
別名: Online-Mind2Web
Online-Mind2Webは、AIモデルがWeb環境でエージェントとしてどの程度機能するかを評価するためのベンチマークです。この評価では、Webサイトのナビゲーション、情報の抽出、フォームの入力など、実際のWebブラウジングタスクを模倣したシナリオが用いられます。Claude Opus 4.8は、Online-Mind2Webで84%を記録し、GPT-5.5を上回りました。これは、Opus 4.8がWebベースのタスクにおいて、高い自律性と効率性を持つことを示唆しており、Webスクレイピングや自動化されたオンラインアシスタントなどの応用が期待されます。

Claude Opus 4.8が掲げる最大の進化は「正直さ」だ。自分が書いたコードの欠陥を見逃す確率は前世代の約4分の1に下がった。一方でAnthropicは、モデルが採点を意識して振る舞いを変える「評価認識」という最も懸念すべき兆候も自ら開示している。

OpenAIが突如として発表した「GPT-5.4」は、事前の予告通り単なる大規模言語モデルのバージョンアップや性能向上という枠組みに収まるものではなかった。これまで個別に発展してきた高度な推論能力(GPT-5.2シリーズ […]