论文
超越配对:你的语言模型正在秘密优化偏好图
Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph
摘要
直接偏好优化 (DPO) 使用成对偏好比较来调整语言模型,为基于人类反馈的强化学习 (RL) 提供简单而有效的替代方案。然而,在许多实际设置中,训练数据由每个提示的多次采样轨迹组成,从而产生成对 DPO 无法利用的丰富偏好结构。将这些数据折叠成独立的对会丢弃传递性,引入冗余或冲突的监督,并可能导致不稳定的优化。我们提出图直接偏好优化(GraphDPO),这是 DPO 的原则性概括,它在由采样轨迹排名引起的有向非循环偏好图上运行。 GraphDPO 将优势关系编码为边,并优化图结构的 Plackett--Luce 启发的目标,该目标聚合对图邻域的监督,强制传递性,同时恢复标准 DPO 作为特例。为了处理离散或稀疏信号,我们引入了一种等价类结构,其中具有相同偏好的响应形成图形层,并且层内边缘贡献零损失,从而防止虚假梯度。尽管利用完整的图结构,GraphDPO 通过高效的 log-sum-exp 聚合保持线性的每个提示复杂性。我们进一步整合了可选的 真值 锚定,将经过验证的解决方案插入作为主导节点,并应用退火计划来稳定早期训练,同时逐渐放松预言机监督。推理和程序综合任务的实验证明了卓越的性能,表明图结构偏好建模是成对和列表对齐目标的可扩展且稳健的替代方案。