论文

Kepler:ARC-AGI-3 的可审计世界模型

Kepler: Auditable World Models for ARC-AGI-3

智能体系统Agent Harness

摘要

ARC-AGI-3 评估交互式环境中的Agent,其规则和目标必须从观察中推断出来。我们提出了 Kepler,一种开源工具,它将假设表示为可执行的世界模型,并通过回顾性转换检查和条件预测检查来验证它们。在一项冻结的 Claude Opus 5 配置下,Kepler 在所有 25 场公开比赛中获得了服务器验证的 100.00 RHAE,没有每场比赛的模型选择或以分数为条件的重新运行。在 183 个已完成关卡中的 181 个中,最终的 Opus 尝试使用的动作不超过相应的中位数人类基线。保留的董事会运行使用了 8,256 个环境操作,其中 7,292 个发生在评分级别中。保留的本地提供商会话记录产生 8.58 亿个词元、97.37% 的缓存读取以及 2026 年 9 月 1 日 API 列表等效费率的 777.72 美元成本。我们还报告了三个评估失败:源代码泄漏导致无效的完美运行,Agent在控制条件下重建已移除的Harness,以及自主修复掩盖了损坏的规划器。单游戏观察案例研究表明,动画帧包含固定文本网格中缺少的任务相关信息。在最终的 Claude Opus 5 和 GPT-5.6 Sol 板上,50 个游戏模型单元中有 48 个达到了 100。这些结果表明,仅公开设置的分数的判别价值有限,并且会激发首次尝试、成本条件和验证意识报告。