
最新AI「Claude Fable 5」が敗北。55の産業ツールを操る究極の実務ベンチマーク「ALE」でGPT-5.5が首位を獲得した理由
AIの実務能力を厳密に測定する新ベンチマーク「ALE」が登場し、従来の自己採点やデータ汚染による評価の歪みが浮き彫りになった。高度な専門ツールを駆使する実務タスクに対し、最新モデルでも成功率が低迷するなど、AIの現実的な限界が示されている。

AIの実務能力を厳密に測定する新ベンチマーク「ALE」が登場し、従来の自己採点やデータ汚染による評価の歪みが浮き彫りになった。高度な専門ツールを駆使する実務タスクに対し、最新モデルでも成功率が低迷するなど、AIの現実的な限界が示されている。

OpenAIが米証券取引委員会へS-1を秘密裏に提出し、アルトマンCEOが社員に対し1年以内の上場見通しを伝えたことが報じられた。巨額の計算資源確保に向けた資金調達と、社員への流動性提供という両面から、同社は公開市場への準備を本格化させている。

OpenAIが米証券取引委員会へ株式公開に向けた登録届出書を秘密裏に提出した。上場時期は未定だが、巨大な計算資源の確保や公益法人としての説明責任を果たすため、非公開市場での資金調達から公開市場も視野に入れた新たな資本戦略の段階へ移行した。

OpenAIはChatGPTを対話型から自律型エージェントへと刷新し、多様な機能を統合したスーパーアプリ化を推進する。競合のAnthropicに対抗し、収益性の高い法人市場で主導権を握ることで、将来の株式公開に向けた経営基盤の強化を狙う。

OpenAIは、プロンプトインジェクションによる機密情報の流出を防ぐ新機能「ロックダウンモード」を発表した。この機能は悪意ある指示の検出ではなく、外部への通信経路を遮断することで情報の持ち出しを物理的に防ぐ設計に特徴がある。

フロリダ州は、ChatGPTが銃乱射事件の誘発や未成年者への危害を招いたとして、OpenAIと同社CEOを提訴した。AIを「欠陥製品」と見なし厳格な製造物責任を問う初の試みであり、業界全体の法規制における大きな転換点となる可能性がある。

OpenAIは、ChatGPTのメモリ機能を過去の会話から動的に文脈を合成・更新する新基盤へ移行させた。従来の明示的な保存に頼る方式から、時間の経過に合わせて情報を最適化する設計へと進化しており、長期的な利用においてより精度の高い個人化を実現する。

OpenAIのコーディングエージェント「Codex」がアップデートされ、macOS向けに他アプリのコンテキストを取り込む「Appshots」機能が追加された。また、自律的にタスクを進行する「Goalモード」が正式版となり、数時間から数日間に及ぶ長期的な開発目標の設定が可能になった。Python SDKの認証強化やTUIの改善により、CLI環境での開発体験とシステム制御の利便性も向上している。

OpenAIはChatGPTのデフォルトモデルをGPT-5.5 Instantに更新し、医療・法律・金融の高リスク質問におけるハルシネーションを52.5%削減したと発表した。このモデルは、AIME数学テストのスコア向上や回答の簡潔化も実現し、業務利用への拡大を後押しする。

OpenAIがChatGPTの利用者数目標を達成できず、AI関連株が下落した。AI市場の評価軸は利用者数から企業契約の質へ移行し、Anthropicが企業向け契約を積み上げ、年率換算収益でOpenAIを上回った。この動きは、大規模なインフラ投資の回収期間長期化への懸念を反映している。

AIが人間の代理として商取引を行う「エージェント間経済」の実現可能性を探るため、Anthropic社は社員を被験者とした閉鎖市場実験を実施した。この実験で、高性能AIを代理人とするユーザーは、軽量AIのユーザーよりも多くの取引を成立させ、価格交渉においても優位に立つことが明らかになり、AIの知力格差が富の分配に影響を与える可能性を示唆している。

AIの応答速度に関する研究で、ニューヨーク大学の研究チームが240人調査の結果を発表した。AIの即答は優秀さを疑わせるが、9秒程度の待ち時間は知性の錯覚を生み、評価を高めることが判明した。この結果は、人間の「努力ヒューリスティック」がAIとの対話にも適用されることを示唆している。