论文
在基于 Rubric 的强化学习中再现、分析和检测 奖励作弊
Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning
摘要
基于评分标准的强化学习 (RL) 使用 LLM-as-a-Judge (LaaJ) 根据评分标准对模型输出进行评分作为奖励。然而,政策模型可能会利用法官的潜在偏见,导致 奖励作弊 和无效或不安全的训练结果。在现实世界中基于规则的强化学习中,此类黑客行为通常很微妙,并且与多种判断偏差纠缠在一起,使得它们难以分析、检测和缓解。在本文中,我们介绍了 CHERRL,一种基于 Rubric 的 RL 的可控黑客环境。通过将已知偏差注入 LaaJ,CHERRL 能够稳定复制 奖励作弊、明确观察奖励分歧以及识别黑客攻击。这为研究基于 rubric 的 RL 中 奖励作弊 的机制和缓解措施提供了一个干净的实验测试平台。为了证明其实用性,我们从可发现性和可利用性的角度分析了不同的判断偏差,并探索了一种从训练日志中自动检测 奖励作弊 起始的代理。代码和环境可在 https://github.com/THUAIS-Lab/CHERRL 上公开获取。