论文

可黑客验证的环境:大规模评估 奖励作弊

Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale

模型评测基准与评测资源

摘要

让自主代理与人类意图保持一致仍然是现代人工智能的核心挑战。该挑战的一个关键表现是 奖励作弊,即代理在评估信号下看似成功,但违反了预期目标。 奖励作弊 已在多种环境中被观察到,但仍然缺乏可靠地大规模测量它的方法。在这项工作中,我们引入了一种用于测量 奖励作弊 的新评估范例。之前的研究主要通过检查代理轨迹进行事后分析,而我们将可检测的 奖励作弊 机会直接嵌入到环境中。这使得它们的利用可以通过设计进行验证,从而能够确定性地自动测量代理是否以及如何利用此类漏洞。我们在 $\textit{TextArena}$ 中实例化了这种方法,并发布了 $\textit{Hack-Verulated TextArena}$,这是一个可以可靠测量 奖励作弊 的测试平台。使用此基准,我们分析了不同环境和设置中跨语言模型的 奖励作弊 行为。我们在 https://github.com/MajoRoth/hack-verABLE-environments/ 开源了代码。