WITNESS:交互解谜环境中的发现、破译与顿悟
Witness: Discovery, Deciphering, and Epiphany in Interactive Puzzle Environments
摘要
自动化科学需要能够通过与陌生环境交互来发现规则的Agent。交互式规则发现谜题为研究这种能力提供了一个受控环境:Agent通过实验推断隐藏规则,并使用其推断的内容来实现既定目标。我们询问当前语言模型在这些难题上的限制是什么,以及强化学习 (RL) 是否可以提高训练中未见的规则的性能。为了研究这两者,我们引入了 WITNESS,这是一个基于 2D 网格的谜题环境,具有真实的 ASCII 观察结果和对规则的受控访问。 agentic 管道为 WitnessGym、RL 训练套件和 WitnessBench 生成游戏,包括公共验证和私人测试游戏。验证集分别测试经过训练的规则原语和训练中缺少的原语的新组合。在共享Harness下,18 个前沿专有和开放权重模型中最好的模型仅解决了 24% 的私有测试关卡槽位,其分数对观察界面和Agent配置敏感。提供真实规则将 Opus-5 的验证 RHAE-L5(前五个级别的相对人类行为效率)从 59.9 提高到 97.8,而 27B 开放权重模型仅获得 2.1 分,即使提供了规则,仍然有限。 WitnessGym 上的 RL 将 27B 模型的私人测试 RHAE-L5 从 2.1 提高到 5.4,并在四个外部发现基准上产生 4.1 点的平均增益。总之,这些结果表明规则获取是 Opus-5 等前沿模型的主要困难,而较小的模型在基于规则的执行方面进一步陷入困境,并表明隐藏规则谜题上的强化学习可以转移到训练之外的更广泛的规则和现实世界任务。基准可在以下位置获取:https://witnessbench.ai
