论文
注意差距:偏好学习中结构感知的一致性
Mind the Gap: Structure-Aware Consistency in Preference Learning
摘要
将 大语言模型 (LLM) 与人类意图保持一致,无论是通过显式奖励建模还是 DPO 等直接方法,从根本上依赖于最小化代理损失作为真正的成对排名目标的代理。我们证明这种依赖对于所使用的标准替代损失是有缺陷的:对于神经网络的等连续假设集特征,没有标准替代提供有意义的一致性保证。将代理损失最小化至零可能会使真实排名误差任意高。为了解决这个问题,我们在边际转移排名框架内制定了 LLM 对齐,并得出 $H$ 一致性界限,表明强制执行置信边际 $γ$ 不仅是有益的,而且对于一致性来说是必要的。我们进一步引入了结构感知$H$一致性和相应的目标(SA-DPO),该目标使边距适应响应之间的语义距离,防止近同义对的不稳定。最后,我们分析了一致性所需的裕度与满足一致性所需的模型的有限容量之间的权衡,揭示了代理损失的严格层次结构:与 DPO 中使用的逻辑损失相比,重尾代理(例如多项式铰链系列)为容量有限模型提供了严格优越的一致性保证。 UltraFeedback 和 Argilla DPO-Mix-7k 上的实验证实,SA-DPO 始终优于 DPO 和 SimPO,在下游生成质量方面的正面胜率达到 58.5%。