论文

传递性满足循环性:动态 大语言模型 对齐的显式偏好分解

Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment

模型训练偏好优化

摘要

标准 RLHF 依赖于传递标量奖励,未能捕捉人类偏好的循环性质。虽然像一般偏好模型(GPM)这样的一些方法解决了这个问题,但我们发现了一个理论上的局限性:它们的隐含公式将层次结构与循环性纠缠在一起,无法保证主导解决方案。为了解决这个问题,我们提出了混合奖励循环(HRC)模型,该模型利用博弈论分解将偏好明确地分解为正交传递(标量)和循环(向量)分量。作为补充,我们引入了动态自我博弈偏好优化(DSPPO),它将对齐视为时变博弈,以逐步引导策略走向纳什均衡。合成数据实验进一步验证了 HRC 在混合传递循环环境中的结构优越性,其中 HRC 比 GPM 收敛速度更快,精度更高。 RewardBench 2 上的实验表明,HRC 相对于 BT 和 GPM 基线持续提高(例如,Gemma-2B-it 上 +1.23%)。特别是,它在 Ties 领域的卓越性能从经验上验证了该模型在处理复杂、非严格偏好方面的稳健性。对 AlpacaEval 2.0、Arena-Hard-v0.1 和 MT-Bench 的广泛下游评估证实了我们框架的有效性。值得注意的是,当使用 Gemma-2B-it 作为基本偏好模型时,HRC+DSPPO 在 AlpacaEval 2.0 上实现了 44.75% 的峰值长度控制胜率,在 Arena-Hard-v0.1 上实现了 46.8%,显着优于使用 BT 或 GPM 训练的 SPPO 基线。我们的代码可在 https://github.com/lab-klc/Hybrid-Reward-Cyclic 上公开获取。