论文
TUR-DPO:拓扑与不确定性感知的直接偏好优化
TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization
摘要
将大语言模型(LLM)与人类偏好对齐通常通过结合近端策略优化(PPO)的人类反馈强化学习(RLHF)实现,或以更简单的方式通过直接偏好优化(DPO)实现。DPO虽然稳定且免强化学习,但它将偏好视为扁平的胜者对败者信号,并对源自脆弱思维链的噪声偏好或脆弱偏好十分敏感。我们提出TUR-DPO,一个拓扑与不确定性感知的DPO变体,它奖励答案的推导方式而不仅是答案内容,其做法是引出轻量的推理拓扑,并将语义忠实度、效用和拓扑质量组合成经校准的不确定性信号。一个小的可学习奖励在这些信号上因子化,并纳入不确定性加权的DPO目标,该目标保持免强化学习,且仅依赖固定或移动的参考策略。实证上,在开源7-8B模型和涵盖数学推理、事实问答、摘要以及有益/无害对话的基准上,TUR-DPO相对DPO提升了评判胜率、忠实度和校准度,同时保持训练简单并避免在线采样。我们进一步观察到在多模态和长上下文设置中的一致增益,并表明TUR-DPO在推理中心任务上持平或超过PPO,同时保持运维简单。
