论文

Se-DPO:用于直接偏好优化的自我进化词元信用

Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization

模型训练偏好优化

摘要

直接偏好优化 (DPO) 通过统一求和来聚合 词元级 对数概率比,隐式地将所有标记视为对偏好信号的同等贡献。然而,各个词元对偏好信号的贡献各不相同。我们引入了词元信用,它根据每个词元对偏好结果的贡献来调节其 KL 正则化。我们得出有效词元信用与每个词元隐性奖励的大小成正比,并观察到该数量在训练期间大幅变化。这意味着随着训练的进展,静态词元信用变得越来越不协调。在这项工作中,我们提出了 Se-DPO(DPO 的自我进化词元信用),这是一种实时机制,可在 DPO 训练期间从模型自身不断演变的内部信号中获取词元信用。由于不同职位的奖励信号的可靠性有所不同,Se-DPO 根据每个词元贡献的强度和置信度来校准词元信用。 Se-DPO 不需要外部模型,仅添加一个计算开销最小的轻量级校准网络。实验表明,Se-DPO 在 AlpacaEval~2 上比 DPO 提高了 9.8 点,在 Arena-Hard 上提高了 12.2 点。