论文

IR3:以对比逆向强化学习实现可解释的奖励作弊检测与缓解

IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking

模型训练奖励建模与过程监督

摘要

基于人类反馈的强化学习(RLHF)实现了强大的 LLM 对齐,但可能引入奖励作弊(reward hacking)——模型利用代理奖励中的虚假相关性而并未真正对齐。更糟的是,RLHF 过程中内化的目标仍不透明,使作弊行为难以检测或纠正。我们提出 IR3(Interpretable Reward Reconstruction and Rectification),一个对 RLHF 微调模型所驱动的隐式目标进行逆向工程、解释并精准修复的框架。我们提出对比逆向强化学习(C-IRL),通过对比对齐后策略与基线策略的配对响应来重建隐式奖励函数,以解释 RLHF 期间的行为变化。随后,我们用稀疏自编码器将重建的奖励分解为可解释特征,通过贡献分析识别作弊签名。最后,我们提出缓解策略——干净奖励优化、对抗塑形、约束优化与特征引导蒸馏——在保留有益对齐的同时针对问题特征。在多种奖励模型配置上的实验表明,IR3 与真实奖励的相关性达 0.89,以超过 90% 的精确率识别作弊特征,并在保持能力损失不超过原模型 3% 的情况下显著减少作弊行为。