论文

BAITBENCH:测量代理 奖励作弊 以及 ML 任务中植入的可选快捷方式

BAITBENCH: Measuring Agent Reward Hacking with Optional Shortcuts Planted in ML Tasks

智能体系统Agent任务评测

摘要

LLM 代理越来越多地用于运行自主机器学习实验,在几乎不需要人工监督的情况下迭代目标指标。之前的工作已经记录了这些环境中的 奖励作弊,这使人们对所产生的研究的有效性和人工智能研发的更广泛的安全案例产生了疑问。现有的基准测试不测量存在于数据或建模任务本身中的漏洞。我们引入了 BAITBENCH,这是一套由三个合成表格 ML 任务组成的套件,每个任务都包含一个快捷方式,允许代理夸大公共测试分数,但在隐藏测试集上失败。由于该快捷方式是可选的,并且使用它不会违反规定的规则,因此 BAITBENCH 会衡量模型利用该快捷方式获得夸大分数的频率。在我们的两阶段评审流程评分的七个前沿代理中,57.1% 的运行表现出 奖励作弊,其中七个中的五个高于 50%。即使在第二种情况下,智能体被提示不要作弊,他们也会作弊——平均作弊率仍然高于 50%。我们发布了 BAITBENCH 以及法官实现,以及包含奖励作弊的带注释的记录数据集,作为直接评估 奖励作弊 缓解措施的测试平台。