论文

TUR-DPO:拓扑与不确定性感知的直接偏好优化

TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization

模型训练偏好优化

摘要

将大语言模型(LLM)与人类偏好对齐通常通过结合近端策略优化(PPO)的人类反馈强化学习(RLHF)实现,或以更简单的方式通过直接偏好优化(DPO)实现。DPO虽然稳定且免强化学习,但它将偏好视为扁平的胜者对败者信号,并对源自脆弱思维链的噪声偏好或脆弱偏好十分敏感。我们提出TUR-DPO,一个拓扑与不确定性感知的DPO变体,它奖励答案的推导方式而不仅是答案内容,其做法是引出轻量的推理拓扑,并将语义忠实度、效用和拓扑质量组合成经校准的不确定性信号。一个小的可学习奖励在这些信号上因子化,并纳入不确定性加权的DPO目标,该目标保持免强化学习,且仅依赖固定或移动的参考策略。实证上,在开源7-8B模型和涵盖数学推理、事实问答、摘要以及有益/无害对话的基准上,TUR-DPO相对DPO提升了评判胜率、忠实度和校准度,同时保持训练简单并避免在线采样。我们进一步观察到在多模态和长上下文设置中的一致增益,并表明TUR-DPO在推理中心任务上持平或超过PPO,同时保持运维简单。

TUR-DPO:拓扑与不确定性感知的直接偏好优化:论文配图
图 1:RLHF、DPO 和 TUR-DPO 概述。 RLHF 根据偏好数据训练奖励模型,并通过 PPO 和 KL 正则化优化策略。 DPO 用相对于参考策略 πref\pi_{\text{ref}} 的直接的、无 RL 的偏好目标替换了该管道。 TUR-DPO 通过将轻量级推理拓扑、语义和不确定性信号纳入成形奖励和不确定性加权 DPO 损失中来增强 DPO;参考策略 πref\pi_{\text{ref}} 可以通过指数移动平均线 (EMA) 更新。右图:TUR-DPO 在代表性基准上的性能改进,使用LLM法官根据基线进行衡量并在人工评估下进行衡量。