论文
偏好优化中的虚假相关学习:机制、后果和通过 Tie Training 的缓解措施
Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training
摘要
已知诸如直接偏好优化 (DPO) 之类的偏好学习方法会导致对虚假相关性的依赖,从而导致当今语言模型中的阿谀奉承和长度偏差,以及未来系统中潜在的严重目标错误概括。在这项工作中,我们对这种现象提供了统一的理论分析,描述了虚假学习的机制、其对部署的影响以及可证明的缓解策略。着眼于对数线性策略,我们表明标准偏好学习目标通过两个渠道诱导对总体水平上的虚假特征的依赖:平均虚假偏差和因果虚假相关泄漏。然后我们表明,这种依赖对分布转移造成了不可减少的脆弱性:来自同一训练分布的更多数据无法减少模型对虚假特征的依赖。为了解决这个问题,我们提出了领带训练,这是一种使用领带(同等效用偏好对)来引入数据驱动的正则化的数据增强策略。我们证明这种方法可以选择性地减少虚假学习,而不会降低因果学习。最后,我们验证了我们关于对数线性模型的理论,并提供了经验证据,证明虚假学习机制和平局训练的好处对于神经网络和 大语言模型 来说仍然存在。