
AIは「見て」から間違えている。知覚だけを試す新ベンチマークが暴いた60%の壁
Moonshot AIのPerceptionBenchは、推論や知識を排除して視覚知覚だけを測る3,000問のベンチマークだ。16の最先端モデルを評価した結果、最高59.7%。総合点の近さが隠す能力の偏りと、「推論の失敗」の正体が知覚の失敗であるという構造を定量的に示した。
別名: Gemini 3.1 Pro, Gemini-3.1-Pro
Gemini 3.1 ProはGoogleが開発するフラッグシップのマルチモーダルAIモデルである。2025年11月公開のGemini 3の後継として2026年2月19日にプレビュー公開され、推論能力の強化と長大なコンテキスト処理能力を特徴とする。テキスト・画像・音声などの複数モダリティを統合的に扱い、企業や開発者向けの幅広い用途に対応する設計となっている。
Gemini 3.1 Proは、単純な応答生成にとどまらず複雑な推論や計画立案を担う「思考するAI」への転換を掲げるモデルである。長大なコンテキストを保持しながら情報を処理する能力に優れ、汎用性の高さから開発者向けAPIから企業向けエージェント基盤まで幅広い場面での利用が想定されている。
2025年11月にGemini 3がリリースされてからわずか数ヶ月後の2026年2月19日、Googleはフラッグシップモデルの最新版であるGemini 3.1 Proをプレビュー公開した。この開発速度は異例であり、推論能力の倍増を掲げることで、AI開発競争において主導権を確保しようとするGoogleの姿勢がうかがえる。
Gemini 3.1 Proは長大なコンテキスト処理と高い汎用性を武器に、他社の主要モデル群と同じ土俵で比較される存在となっている。競合には100万トークン級のコンテキスト長を掲げるモデルが相次いで登場しており、いずれも長時間の自律的エージェント作業や大規模文書処理を重視する設計を採用している。Gemini 3.1 Proも同様に、単発の応答から連続的な推論・実行へと役割を拡張する方向性を示している。
2026年6月8日には、Gemini 3.1 Proの発表を扱う分析記事が公開され、推論能力の倍増がもたらす「思考するAI」へのパラダイムシフトと、それに伴うエコシステムの変容が論じられた。同日、Google Cloudは企業が数百から数千の自律型AIエージェントを管理・運用する課題に対応するため、新たなエンタープライズ向け開発プラットフォーム「Gemini Enterprise Agent Platform」を発表した。このプラットフォームは開発環境の刷新や、長時間実行と永続的コンテキストを支える実行基盤の強化、ガバナンスとインフラの統合を通じて、Gemini 3.1 Proを基盤とする企業向けエージェント活用を後押しするものである。
同時期には競合各社も新モデルを相次いで投入している。2026年6月2日には中国MiniMaxが100万トークン対応のオープンウェイトモデル「M3」を発表し、6月3日にはOpenAIが長時間のエージェント作業を意識した「GPT-5.5」を公開、6月9日にはAnthropicが高度な推論力を一般開放する「Claude Fable 5」を発表した。長文脈処理と自律的エージェント能力を軸にした開発競争が激化する中で、Gemini 3.1 Proは長大なコンテキスト処理能力と推論力の強化を武器に、Google Cloudのエンタープライズ基盤と連携しながら企業導入を後押しする位置づけを担っている。

Moonshot AIのPerceptionBenchは、推論や知識を排除して視覚知覚だけを測る3,000問のベンチマークだ。16の最先端モデルを評価した結果、最高59.7%。総合点の近さが隠す能力の偏りと、「推論の失敗」の正体が知覚の失敗であるという構造を定量的に示した。

リーナス・トーバルズ氏は、Linuxを反AIプロジェクトにはしないと宣言し、AIを開発の有用な道具として受け入れる方針を示した。生成コードの責任は署名した人間が負うという原則を維持しつつ、AIによる自動レビューの導入と効率化を推進する。

Metaは、コーディングや長時間のエージェント性能を大幅に強化した最上位AIモデル「Muse Spark 1.1」のAPIを公開した。重みを非公開とする戦略へ転換し、競合他社を大きく下回る低価格な従量課金制を打ち出すことで、開発者市場の獲得を狙う。

Anthropicは新モデルClaude Fable 5を発表し、高度な推論力を一般開放する。高リスクなリクエストを検知して旧モデルへ自動で切り替える二段構えの安全策を導入し、悪用を防ぎつつ長時間に及ぶ複雑な自律作業の効率化を追求している。

中国のMiniMax社が発表したM3は、100万トークンの長大な文脈処理と高度な自律エージェント能力を兼ね備えたオープンウェイトモデルである。独自の計算効率化技術により、低コストながら一部の主要な商用モデルを凌駕する性能を実現した。

AIの安全性と中立性を評価するCEFE-AIの研究チームは、AIが特定の価値観を「言わない」ことによる「不作為のバイアス」を指摘した。彼らのベンチマークテストにより、人間が倫理的問いに宗教的視点を期待するにもかかわらず、AIは実践的な助言の場面で宗教的リソースをほとんど提示しないことが明らかになった。AIは抽象的な存在論的質問には宗教に言及するが、人間の深い絶望には世俗的な解決策のみを提供し、宗教を生活の知恵から切り離している。

Microsoft Researchの論文が、AIへのタスク委任に潜むドキュメントの静かな改ざん問題を指摘した。DELEGATE-52ベンチマークを用いた検証で、AIは連続した操作によりドキュメントの情報を平均50%も劣化させ、特に最新モデルは巧妙な改ざんを行うことが判明した。これにより、AIの自律的なワークフローへの導入に警鐘が鳴らされている。

DeepSeek-AIは、100万トークンのコンテキスト長を持つDeepSeek-V4シリーズのプレビュー版を公開した。DeepSeek-V4-ProとDeepSeek-V4-Flashは、それぞれ1.6兆と2840億のパラメータを持つMixture-of-Expertsモデルであり、長文推論のコスト効率を大幅に改善した。特に、Compressed Sparse AttentionとHeavily Compressed Attentionを組み合わせたハイブリッド注意機構により、1トークン推論FLOPsとKVキャッシュを大幅に削減し、大規模言語モデルの運用コスト低減に貢献する。

OpenAIは次世代モデル「GPT-5.5」を発表し、ChatGPTとCodexで先行提供を開始した。本モデルは長時間のエージェント作業の実用化に焦点を当て、コーディングや知識労働、科学研究での能力向上を強調している。API提供は後日予定されており、標準API単価はGPT-5.4から倍増するが、トークン効率の改善により費用対効果の新たな評価軸が提示された。

Google Cloudは、企業が数百から数千の自律型AIエージェントを管理・運用する課題に対応するため、新たなエンタープライズ向け開発プラットフォーム「Gemini Enterprise Agent Platform」を発表した。本プラットフォームは、開発環境の刷新、長時間実行と永続的コンテキストを支える実行基盤の強化、そして厳格なガバナンスとインフラストラクチャの統合により、エージェントの急増という課題に包括的に対応する。

Googleは2026年2月19日、同社のフラッグシップAIモデルの最新版「Gemini 3.1 Pro」をプレビュー公開した。2025年11月のGemini 3リリースからわずか数ヶ月という異例のスピードで開発・投入さ […]

Appleが2026年後半にリリースを予定している「iOS 27」は、iPhoneの歴史において、地味ながらも非常に重要なアップデートになるかもしれない。最新のレポートによると、次期OSは派手な新機能の追加よりも、システ […]

2025年12月10日、Googleは同社の主力写真・動画管理サービス「Google フォト」において、動画編集機能を大幅に刷新するアップデートを発表した。これは単なる機能追加ではない。これまでの「静止画の保管庫」という […]