论文

ARC-AGI-3:面向前沿智能体智能的新挑战

ARC-AGI-3: A New Challenge for Frontier Agentic Intelligence

智能体系统Agent任务评测

摘要

我们提出ARC-AGI-3,一个通过新颖、抽象、回合制环境研究智能体智能的交互式基准,其中智能体必须在没有明确指令的情况下进行探索、推断目标、构建环境动力学的内部模型,并规划有效的动作序列。与其前作ARC-AGI-1和ARC-AGI-2一样,ARC-AGI-3完全聚焦于评估在新颖任务上的流畅自适应效率,同时规避语言与外部知识。ARC-AGI-3环境仅利用核心知识(Core Knowledge)先验,并通过与人类测试者的广泛测试进行难度校准。我们的测试显示,人类可以解决100%的环境,而截至2026年3月,前沿AI系统的得分低于1%。在本文中,我们介绍了该基准的设计、以人类动作基线为基础的基于效率的评分框架,以及用于构建、验证和校准环境的方法论。

ARC-AGI-3:面向前沿智能体智能的新挑战:论文配图
图1:自2019年ARC-AGI发布以来,各前沿AI模型在其上的成绩演进。