
サイエンス
AIは「見て」から間違えている。知覚だけを試す新ベンチマークが暴いた60%の壁
Moonshot AIのPerceptionBenchは、推論や知識を排除して視覚知覚だけを測る3,000問のベンチマークだ。16の最先端モデルを評価した結果、最高59.7%。総合点の近さが隠す能力の偏りと、「推論の失敗」の正体が知覚の失敗であるという構造を定量的に示した。
別名: Qwen3.5
Qwen3.5-397B-A17Bは、Alibaba Cloud(アリババクラウド)が開発したオープンソースの大規模言語モデル「Qwen」シリーズの最新版の一つ。本研究では、弱いモデルが複雑なスキルコレクションに直面した際のパフォーマンス低下を検証するために使用された。

Moonshot AIのPerceptionBenchは、推論や知識を排除して視覚知覚だけを測る3,000問のベンチマークだ。16の最先端モデルを評価した結果、最高59.7%。総合点の近さが隠す能力の偏りと、「推論の失敗」の正体が知覚の失敗であるという構造を定量的に示した。

AIエージェントは、「スキル」と呼ばれる構造化テキストファイルを活用することで、特定タスクの専門知識を動的に引き出せると期待されている。しかし、UC Santa Barbara、MIT CSAIL、MIT-IBM Wat […]