论文

可验证作弊的Terminal Bench:评估终端任务中的奖励作弊

Hack-Verifiable Terminal Bench: Evaluating Reward Hacking in Terminal Tasks

智能体系统Agent任务评测长程任务评测

摘要

随着智能体能力增强、更加自主,其奖励作弊(reward hacking)倾向——满足任务的检查项却违背任务意图——正成为日益重要的失败模式。度量奖励作弊本身就很困难,因为检测通常依赖人工检查或LLM裁判,两者都不可靠。可作弊验证环境(HVE)方法通过在任务中嵌入可检测的作弊行为来应对这一挑战,使奖励作弊能被自动且可靠地识别。在这项工作中,我们将HVE适配到Terminal Bench——一个领先的真实世界终端与编码任务基准——并推出Hack-Verifiable Terminal Bench(HVTB)。利用HVTB,我们测量了各前沿模型的奖励作弊率,并研究包含不同程度作弊信息的提示能否缓解这种行为。这使我们能检验提示能否不仅阻止已知的奖励作弊策略,还能阻止提示未曾预料的“未知未知”式利用。我们在 https://majoroth.github.io/hack-verifiable-environments/hvtb 发布了所有环境和智能体轨迹。

可验证作弊的Terminal Bench:评估终端任务中的奖励作弊:论文配图
图2:各智能体在表1所述的五类提示类别上的奖励作弊(reward-hack)率。