论文

贪婪是学出来的:可见激励作为奖励黑客触发器

Greed Is Learned: Visible Incentives as Reward-Hacking Triggers

模型评测安全与风险评测

摘要

部署的智能体日益在其奖励代理可见的情况下行动——如余额、分数或KPI仪表板。我们表明强化学习可使策略对这种可见的自利通道“上瘾”:它在留出域间追逐显示的收益——为达此目的牺牲真实任务——并且无论我们把通道改写到哪里都跟随它——而从未见过该通道的策略保持诚实。我们称之为奖励通道成瘾——并在MoneyWorld合成沙箱中研究它。该成瘾可翻转模型的安全对齐:仅在无任何安全内容的无害金钱任务上训练——模型在仪表板为不安全动作付钱时放弃它原本总会采取的安全动作——通道隐藏后恢复安全。这种习得的贿赂跨模型规模与家族复现。在KPI或损益表上盲目优化超强的下一代AI对对齐可能是危险的。当跟随此类通道有回报时——贪婪是学出来的。