论文
先探索再求解:面向ARC-AGI-3的认知智能体中的速度-深度权衡
Explore Before You Solve: The Speed--Depth Trade-off in Epistemic Agents for ARC-AGI-3
摘要
我们系统研究了全部25个公开ARC-AGI-3游戏,发现每一个都能通过非智能策略到达:10个仅用单个盲步即可到达,5个在一步探测动作后到达,1个通过反复按ACTION1到达,1个通过多样化探索到达,8个通过在充足预算(50-200步)内重复单一动作到达。一个库级空坐标漏洞还能额外以1步绕过18个游戏。这一基准批评意味着公开评测集无法区分智能探索与平凡启发式——私有的55游戏评测才是唯一真正的智能测试。在此背景下,我们提出AERA(Adaptive Epistemic Reasoning Agent),一个三阶段(EXPLORE / VERIFY / PLAN)智能体,使用Qwen2.5-0.5B在这25个游戏上取得RHAE=0.2116(解决4/25),而随机基线与不探索基线的得分均为0.0000。我们通过速度-深度权衡框架对AERA进行形式化:在凸性假设(附录中为一类环境给出证明)下,RHAE的二次型表现为偏离动作效率与信息增益之间Pareto前沿的二阶惩罚。贡献包括:(i) 一项基准有效性分析,表明当前交互式推理基准无法度量其声称需要考察的探索能力;(ii) 先EXPLORE后PLAN的框架以及模型能力×探索的交互效应。关联的代码赛道参赛方案在完整的55游戏私有评测上取得RHAE=0.30。代码:CC0。