论文
RevengeBench:通过行为实验对代码空间策略进行逆向工程
RevengeBench: Reverse Engineering Code-Space Policies from Behavioral Experiments
摘要
在科学史上的大部分时间里,研究行为的研究人员只能从外在行为中推断出隐藏的机制:当通过有针对性的干预增强观察时,逆向问题变得更容易处理。我们提出一个计算类比:仅给定游戏环境中代理的行为痕迹,学习者能否将底层决策程序重建为可执行代码,以及通过设计受控实验的能力,这种重建能提高多少?我们引入了 RevengeBench,这是一个由 75 个 LLM 生成的基准,跨五个游戏环境进行 Elo 校准策略,取自 CodeClash 锦标赛轨迹。学习者观察隐藏目标策略与样本对手的对抗,并以自定义对手策略的形式设计行为探针,以引发信息行为。然后,它提交一个可执行的假设,并使用连续的行动距离指标对其进行评估。我们进一步验证恢复的代码在下游玩家对玩家锦标赛中携带信息信号。在 12 个前沿 LLM 中,恢复质量差异很大(初始距离闭合的 34% 至 72%),重建的政策产生可衡量的竞争优势,特别是对于较弱的模型,否则很难设计有效的反策略。我们的基准将程序化政策的行为恢复定位为代码空间中易于处理的逆问题,为对手建模、政策可解释性以及从观察中推断潜在机制的更广泛问题开辟了道路。