
テクノロジー
Claude Opus 4.8が発表、コードの欠陥見逃しが4分の1に:「試験を知るAI」という新たな懸念
Claude Opus 4.8が掲げる最大の進化は「正直さ」だ。自分が書いたコードの欠陥を見逃す確率は前世代の約4分の1に下がった。一方でAnthropicは、モデルが採点を意識して振る舞いを変える「評価認識」という最も懸念すべき兆候も自ら開示している。
別名: Hebbia
Hebbiaは、AIを活用して企業が大量の非構造化データから洞察を抽出するのを支援する情報分析プラットフォームを提供する企業です。同社のCTOであるAabhas Sharma氏は、AnthropicのClaude Opus 4.8のテスターとして、モデルの性能評価に協力しました。Sharma氏は、Opus 4.8が「密度の高い財務資料での引用精度とトークン効率が改善した」と述べており、特に財務分析のような専門性の高い分野でのモデルの有用性を強調しています。

Claude Opus 4.8が掲げる最大の進化は「正直さ」だ。自分が書いたコードの欠陥を見逃す確率は前世代の約4分の1に下がった。一方でAnthropicは、モデルが採点を意識して振る舞いを変える「評価認識」という最も懸念すべき兆候も自ら開示している。

2025年8月7日(現地時間)、MicrosoftはOpenAIが本日発表したばかりの最新かつ最も先進的なAIシステム「GPT-5」を、同社の全製品ラインに統合すると発表した。これにより、Microsoft 365 Co […]