论文

面向ARC-AGI-1抽象推理与泛化的成本高效智能体治控

Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1

智能体系统Agent Harness

摘要

ARC-AGI-1上来自已披露架构的近期进展大体来自两个regime:前沿模型上的重测试时计算(进化搜索、穷举采样、扩展思维链),或基准专属训练(小模型在ARC数据上微调、常配任务专属架构)。我们研究第三regime:严格预算下、非思考模式的开放权重模型(DeepSeek V3.2)、无ARC专属微调。我们研究仅靠架构能恢复什么——构建显式分解模式发现与程序合成阶段的智能体治控。首先引入Explorer-Definer管线:分离模式发现与可执行变换合成的两阶段智能体管线。其次呈现反思编排器:在既往假设于训练对上失败时,自主探索新变换增强管线。在ARC-AGI-1公开400任务评估集上:管线以每任务0.25美元达到57.50% pass@2,编排器以每任务0.62美元达到67.25% pass@2——两架构合计把15.50%的一次基线提升约52分,无基准专属训练或重测试时计算。此外编排器驱动的提升检验了管线产出的可证伪诊断;无偏pass@k分析提示管线是生成受限而非选择受限(经训练对准确率的选择捕获候选上限约95%),并预测显著改进需要更广生成而非更好排序。编排器经自适应再探索实现该预测并确认之(无偏pass@1提升+9.81分)。管线消融识别think工具为重要组件——移除使pass@2降5.75分。

面向ARC-AGI-1抽象推理与泛化的成本高效智能体治控:论文配图
图 1:PatternExplorer 代理。