论文

编码智能体时代的ARC-AGI-3可执行世界模型

Executable World Models for ARC-AGI-3 in the Era of Coding Agents

智能体系统Agent 架构与控制循环

摘要

我们评估了 ARC-AGI-3 的初始编码代理系统,其中代理维护一个可执行的 Python 世界模型,根据之前的观察对其进行验证,将其重构为更简单的抽象,作为类似 MDL 的简单性偏差的实际代理,并在行动之前通过模型进行计划。该系统故意是直接的:它使用脚本控制器、预定义的世界模型接口、验证程序和计划执行器,但没有手动编码的游戏特定逻辑。我们报告 25 场公开 ARC-AGI-3 游戏的结果。每个记录的游戏都使用一个新的代理实例,无法访问之前的特定于游戏的文件或对话状态。大多数游戏都有一个录制的游戏过程;对于一些游戏,我们报告了多个独立的新代理游戏体验,以揭示运行之间的差异。该智能体完全解决了 7 场比赛,在 6 场比赛中实现了大于 75% 的相对人类行动效率,并获得了平均每场比赛 RHAE 32.58%。由于该系统不使用特定于游戏的代码,因此它可以作为 ARC-AGI-3 的游戏通用基线。私有验证集上的性能仍有待测试。总体而言,结果提供了初步证据,表明验证者驱动的可执行世界模型对于 ARC-AGI-3 代理来说是一种有前途的方法。