论文

TokenRatio:通过比率匹配进行有原则的 词元级 偏好优化

TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching

模型训练偏好优化

摘要

直接偏好优化(DPO)是一种广泛使用的无强化学习方法,用于根据成对偏好调整语言模型,但它对整个序列的偏好进行建模,即使生成是由每个词元决策驱动的。现有的 词元级 扩展通常会跨时间步分解序列级 Bradley-Terry 目标,从而隐含每个前缀(状态方面)的最优性。我们研究如何仅使用标准序列级成对比较来恢复 词元级 偏好最优性。我们引入了 词元级 Bregman 偏好优化(TBPO),它针对前缀条件下的下一个词元动作假设了 词元级 Bradley-Terry 偏好模型,并导出了 Bregman 散度密度比匹配目标,该目标推广了逻辑/DPO 损失,同时保留了 词元级 模型引起的最优策略并保持类似 DPO 的简单性。我们引入两个实例:TBPO-Q,它显式地学习轻量级状态基线;TBPO-A,它通过优势归一化删除基线。在指令遵循、有用/无害和摘要基准方面,TBPO 提高了比对质量和训练稳定性,并相对于强大的序列级和 词元级 基线增加了输出多样性。