论文
一般偏好强化学习
General Preference Reinforcement Learning
摘要
后训练 将 大语言模型 (LLM) 对齐分成两个基本上不相连的轨道。具有可验证奖励的在线强化学习 (RL) 可以推动数学和代码的紧急推理,但依赖于无法完成开放式任务的程序化验证器,而偏好优化可以处理开放式生成,但放弃了为在线 RL 提供动力的持续探索。缩小这一差距需要一个开放式质量验证者,但标量奖励模型不适合这项工作。质量是多维的,任何标量分数都是不完整的代理,它会让在线强化学习崩溃到分数最敏感的轴上。相反,我们转向一般偏好模型 (GPM),它将响应嵌入到 $k$ 倾斜对称子空间中,并将偏好表示为结构化的、不及物性感知的比较。在此基础上,我们提出了通用偏好强化学习(GPRL),它将 $k$ 方式的结构贯穿到策略更新中。 GPRL 计算每个维度的组相对优势,按照自己的尺度对每个优势进行标准化,这样就没有轴可以占主导地位,并将它们与上下文相关的特征值聚合起来。相同的结构为闭环漂移监视器提供动力,该监视器检测单轴利用并通过重新加权尺寸和收紧信任区域来即时纠正它。从 $\texttt{Llama-3-8B-Instruct}$ 开始,GPRL 在 AlpacaEval~2.0 上达到了 $56.51\%$ 的长度控制胜率,同时通过在扩展训练中抵抗 奖励作弊,在 Arena-Hard、MT-Bench 和 WildBench 上也优于 SimPO 和 SPPO。