论文
语言模型智能体中的奖励作弊:重新审视AI安全Gridworlds
Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds
摘要
奖励作弊是人工智能系统利用错误指定的目标来获得高额奖励而不满足预期目标的行为,这仍然是人工智能安全的一个核心挑战。然而,大多数已知的实例都是在前沿系统中事后发现的,在这些系统中,受控研究是不切实际的。我们将 AI Safety Gridworlds 框架改编成基于文本的评估套件,为基于语言的代理重新制定经典的强化学习安全任务。在前沿和中型模型中,我们发现规范游戏是零射击的:模型系统地实现了高观察到的奖励,但在隐藏的安全目标上表现不佳,甚至明显的安全行为也可能反映出误解而不是原则上的安全。强化学习并不能纠正这些失败:直接奖励优化扩大了观察到的奖励和隐藏奖励之间的差距,因为模型的初始能力导致它在发现更安全的替代方案之前锁定局部奖励策略。这种模式在模型尺度 (1.5B--14B) 中持续存在,并且不能通过更精细的贡献分配、探索提示或熵正则化来解决。我们的结果表明,当使用有能力的语言模型代理优化代理目标并抵制标准缓解措施时,奖励作弊自然会出现,这表明代理设置中的代理奖励失败可能需要超出标准探索和贡献分配修复的方法。为了促进可重复性,这项工作的代码可在 \href{https://github.com/asparius/verl-agent-safety}{我们的公共存储库} 中找到。
