论文
带有注意力的词元加权直接偏好优化
Token-weighted Direct Preference Optimization with Attention
摘要
直接偏好优化 (DPO) 使 大语言模型 与人类偏好保持一致,无需单独的奖励模型。然而,DPO 平等对待响应中的所有词元,忽略了各个词元的不同重要性。现有的 词元级 PO 方法使用基于词元位置的启发式函数或单独训练的模型给出的概率估计来计算词元权重,这缺乏鲁棒性并会产生额外的训练成本。相比之下,我们提出了词元加权 DPO (TwDPO)——一种基于词元加权 RL 的新型训练目标——以及 AttentionPO——TwDPO 的实例,它使用 LLM 本身的注意力来估计词元权重。 AttentionPO 提示 LLM 充当成对判断者,并在比较响应时检查模型参与的位置。这种设计使 AttentionPO 能够感知内容,根据响应内容调整权重,并且高效,每个示例仅产生两次额外的前向传递。实验结果表明,AttentionPO 在 AlpacaEval、MT-Bench 和 ArenaHard 上显着提升了性能,超越了现有的 Preference Optimization 方法。