
Claude Opus 4.8が発表、コードの欠陥見逃しが4分の1に:「試験を知るAI」という新たな懸念
Claude Opus 4.8が掲げる最大の進化は「正直さ」だ。自分が書いたコードの欠陥を見逃す確率は前世代の約4分の1に下がった。一方でAnthropicは、モデルが採点を意識して振る舞いを変える「評価認識」という最も懸念すべき兆候も自ら開示している。
Tech Product
OpenAIが開発した大規模言語モデル。長文理解と複雑なタスク実行を可能にするエージェント機能を強化し、2026年に投入された次世代モデルである。
全 29 件 / 3 ページ

Claude Opus 4.8が掲げる最大の進化は「正直さ」だ。自分が書いたコードの欠陥を見逃す確率は前世代の約4分の1に下がった。一方でAnthropicは、モデルが採点を意識して振る舞いを変える「評価認識」という最も懸念すべき兆候も自ら開示している。

GoogleはGoogle I/O 2026で、エージェント処理に特化した高速・低コストな新モデルGemini 3.5 Flashと、自律型エージェント開発プラットフォームAntigravity 2.0を発表した。これにより、企業は年間10億ドル以上のコスト削減を期待でき、個人向けには常時稼働する自律型AIエージェントGemini Sparkを提供するなど、AIエージェント社会実装への移行を明確にした。

Anysphereは、独自の後処理と強化学習を施したAIコーディングモデル「Composer 2.5」を発表した。このモデルは、競合するフロンティアモデルと同等水準のベンチマーク性能を約10分の1のコストで実現し、テキストフィードバックによる強化学習や1兆パラメータ規模の最適化などの高度な技術に支えられている。

OpenClawの創設者Peter Steinberger氏らは、3人のチームで100のAIエージェントを常時稼働させ、1ヶ月で130万ドルのOpenAI API費用を計上した。このエージェント群はコードレビューやセキュリティ監査、バグ修正などソフトウェア開発のあらゆるフェーズを自律的に処理しており、トークンが開発の新たな生産手段となり、少人数チームによる大規模開発を可能にすることを示唆している。

OpenAIは、大規模言語モデルの性能差が縮小する中で、顧客企業へのモデル統合深度を競争軸とするため、独立子会社DeployCoを設立した。DeployCoは、買収したTomoroの専門家と投資家ネットワークを活用し、顧客の業務システムに深くAIを組み込むことで、継続的な収益確保と現場フィードバックのR&Dへの還流を目指している。

OpenAIはGPT-5.5の価格をGPT-5.4比で2倍に引き上げたが、OpenRouterの実測では入力長に応じてコストが49〜92%増加した。特に2,000トークン未満の短プロンプトで最大92%のコスト増となり、AIエージェント開発者への影響が深刻である。長プロンプトでは応答が短縮されるものの、全体的なコスト削減効果は限定的で、Anthropicも同様の値上げ傾向にある。

OpenAIはChatGPTのデフォルトモデルをGPT-5.5 Instantに更新し、医療・法律・金融の高リスク質問におけるハルシネーションを52.5%削減したと発表した。このモデルは、AIME数学テストのスコア向上や回答の簡潔化も実現し、業務利用への拡大を後押しする。

AIの真の推論能力を測るため、NIST傘下のCAISIが非公開テストを実施した結果、中国のDeepSeek V4 Proは公開ベンチマークでの自己申告とは異なり、米国の最先端モデルに約8ヶ月の遅れをとっていることが判明した。これは、公開テストへの過剰適合を排除し、米中間のAI技術格差を冷徹に浮き彫りにした評価である。

2026年4月公開のGPT-5.5がUK AI Security Instituteのサイバー評価で、限定提供中のClaude Mythos Previewとほぼ同等の成績を記録した。この結果は、公開モデルと限定モデルの能力差が縮まり、危険なAI能力が特定の非公開モデルに限定されないことを示唆している。そのため、AIの安全対策はモデル性能よりも、誰にどの権限で利用させるかが中心となる。

最新のAIモデルを利用する際、不自然な比喩表現に違和感を覚えたことはないだろうか。専門的なコードや複雑な概念を尋ねているのに、AIが突然「ゴブリン」や「アライグマ」を引き合いに出して解説を始める現象が報告されている。なぜ最先端のAIが、ファンタジーの住人や小動物に執着するようになったのか。その裏には、AIの強化学習プロセスに潜む思わぬ罠があった。OpenAIの最新モデル「GPT-5.5」のシステムプロンプトに急遽追加された異例の禁止令から、AIが特定の表現を自己増殖させてしまうフィードバックループの仕組みを紐解く。

OpenAIは、GPT-5.5への移行を検討する開発者に対し、古いプロンプトの流用は性能を低下させる可能性があると警告している。これは、GPT-5.5の推論効率が向上したことで、詳細な手順指定がノイズとなり、モデルの探索空間を狭めるためだ。開発者は、7部品プロンプト設計などの新しいガイドラインに基づき、最小限の指示からプロンプトを再構築する必要がある。

OpenAIは次世代モデル「GPT-5.5」を発表し、ChatGPTとCodexで先行提供を開始した。本モデルは長時間のエージェント作業の実用化に焦点を当て、コーディングや知識労働、科学研究での能力向上を強調している。API提供は後日予定されており、標準API単価はGPT-5.4から倍増するが、トークン効率の改善により費用対効果の新たな評価軸が提示された。