论文
编码智能体解题需要可执行世界模型、简化与验证吗——ARC-AGI-3实证
Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?
摘要
我们此前的ARC-AGI-3智能体捆绑了可执行世界建模、提示式简化与精确重放验证,但各自的贡献并不清楚。可执行世界模型是以可运行代码体现的、由智能体持有的持久环境假设。我们比较四种基于Codex的变体:纯文本式;灵活接口的可执行式;带简化提示的可执行式;以及带简化与对记录观测的精确重放验证的固定接口式。主研究在25个公开游戏上以gpt-5.4与gpt-5.5在高与超高推理档位评估各变体;探索性后续用gpt-5.6-sol比较文本式与验证式。主研究中,所有变体随模型能力与推理档位提升而得分提高;这些增益往往超过变体间差异,后者比预期更小且随设置变化。强制可执行交付物并非普遍有益:在两个gpt-5.5条件下文本式均优于灵活接口可执行式。简化式在四分之三的设置中高于纯可执行式,最弱设置是例外。完整验证式始终排名第一、有时优势微弱,但消耗显著更多资源。使用gpt-5.6-sol时,验证式在超高与最高档位完成全部公开关卡,人类相对动作效率约99%,总动作数不足人类基线一半;而在最高档位,文本式以比人类基线少41%的动作完成全部关卡。因此在最高档位,三项外加机制并非动作高效完成公开集的必要条件;但验证式得分更高且能在更低推理档位成功。由于gpt-5.6-sol晚于游戏发布且未测试留出集,结果仅表明公开集已趋饱和。
