论文
定向对齐可缓解语言模型强化学习中的 奖励作弊
Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
摘要
当模型通过利用捷径而不是解决预期任务来提高代理奖励时,就会出现 奖励作弊。我们通过语言模型中强化学习更新的几何结构来研究这种故障模式,并认为当优化偏离稳定的低维学习轨迹时,就会出现黑客行为。我们通过参数更新的主要奇异方向分析了这种漂移,并表明 奖励作弊 运行表现出比干净运行大得多的方向变化。受此观察的启发,我们引入了可信方向投影,它将梯度限制在干净的参考子空间内。在 奖励作弊 数学推理实验中,所提出的方法延迟了捷径利用并更好地保持了任务性能。