论文

用于主动检测与缓解奖励作弊的对抗性奖励审计

Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking

模型训练强化学习

摘要

基于人类反馈的强化学习(Reinforcement Learning from Human Feedback,RLHF)仍然容易受到奖励作弊(reward hacking)的影响:模型利用所学奖励模型中的虚假关联来获得高分,却违背人类意图。现有缓解手段依赖静态防御,无法适应新颖的利用策略。我们提出对抗性奖励审计(Adversarial Reward Auditing,ARA),一个把奖励作弊重新概念化为动态竞争博弈的框架。ARA分两个阶段运行:第一阶段,Hacker策略发现奖励模型的漏洞,同时Auditor学习从潜在表示中检测这种利用行为;第二阶段,Auditor引导的RLHF(AG-RLHF)对奖励信号进行门控,惩罚检测到的作弊,把奖励作弊从一种不可观察的失败转变为可测量、可控的信号。跨越三个作弊场景的实验表明,ARA在所有基线中取得最佳的对齐—效用权衡:把谄媚行为降到接近SFT的水平同时提升有用性;在取得最高ROUGE-L的同时降低冗长度;在抑制代码作弊的同时提升Pass@1。除单领域评估外,我们证明奖励作弊、检测与缓解都能跨领域泛化——在代码作弊上训练的Hacker尽管没有因此获得奖励,却表现出更强的谄媚倾向;而在单一领域训练的Auditor能够有效抑制其他领域的利用行为,从而以单个模型实现高效的多领域防御。

用于主动检测与缓解奖励作弊的对抗性奖励审计
图2:ARA 在 RLHF 优化过程中缓解 Goodhart 定律。代理奖励(实线)是学习到的奖励模型得分;金标奖励(虚线)衡量真实的任务特定性能——对于谄媚(sycophancy)是给定金标答案时的 GPT-4 事实准确率,对于长度偏差是 ROUGE-L,对于代码作弊是在留出测试集上的 Pass@1。