论文

Tycho:以程序化世界模型为ARC-AGI-3实现主动抽象

Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3

智能体系统Agent 规划

摘要

ARC-AGI-3 将抽象转化为一个交互式的技能习得问题。玩家必须推断陌生游戏的规则、隐藏状态与目标,同时保持动作效率,因为每一步行动都至关重要。我们将这些环境形式化为参数化的、带渲染的确定性 Moore 机,并提出 Tycho——一个在交互过程中构建并使用游戏专用模型的编码智能体系统。Tycho 将可行动观察与中间动画、关卡完成和游戏结束帧区分开来。基于这一结构化历史,智能体可以对自由形式的可执行假设进行建模、测试、用于规划、修复或绕过。在推理预算匹配、每种策略各跑一次匹配公开集运行的条件下,我们使用 Claude Opus 4.8 在全部 25 个公开游戏上比较四种编排策略。由行动者主动请求委派给模型构建者的策略取得观测到的最高平均相对人类动作效率(Relative Human Action Efficiency,RHAE)88.49。采用该选定策略,GPT-5.6 Sol 与 Opus 5 均达到 100.00 RHAE 并完成全部 183 个关卡。它们经游戏平衡的首轮人类重放中位排名分别为 98.5 和 100.0。Opus 5 的计分动作数比官方人类基线总量少 61%。验证失败后的自动修复所产生的模型能更准确地复现观察到的状态转移,却仅达到 83.07 RHAE。状态转移匹配只表明模拟器能否复现观察到的动力学,并不表明它已识别出目标或能改进下一步动作。高水平游玩还需要决定何时构建、修复、使用或绕过模型。我们将这一联合问题称为主动抽象:从高代价的交互中生成可检验的模型,并决定获取或使用该模型的时机是否物有所值。