论文
GAW-PO:使用梯度对齐的词元权重进行偏好优化
GAW-PO: Preference Optimization with Gradient-Aligned Token Weights
摘要
大多数偏好优化方法,例如直接偏好优化(DPO),在响应级别应用偏好监督,尽管自回归语言模型是逐个词元优化的。因此,被拒绝的响应中的所有词元都会产生负面训练信号,包括可能编码对首选响应有用的行为的词元。我们引入了 GAW-PO,一种用于 DPO 的梯度对齐词元重新加权方法,它针对每个被拒绝的词元估计对其进行惩罚是否会干扰首选更新方向。梯度与首选行为强烈一致的词元会收到较弱的负贡献,而冲突的词元则保留较强的惩罚。我们的方法在所评估的偏好优化方法中实现了最高的平均性能,比标准 DPO 提高了 0.97 分,比数学、推理、编码和问答等 11 个基准的最强竞争基线提高了 0.65 分。我们进一步表明,梯度对齐加权对于激进的偏好优化来说更加稳健:随着 DPO 正则化参数 $β$ 的减小,标准 DPO 急剧下降,而 GAW-PO 继续改善。这些结果表明,考虑拒绝的词元更新和偏好行为之间的相互作用为偏好优化提供了词元级信用分配的有效形式。