论文

分解Delta:模型实际上从偏好对中学到了什么?

Decomposing the Delta: What Do Models Actually Learn from Preference Pairs?

模型训练偏好优化

摘要

DPO 和 KTO 等偏好优化方法广泛用于对齐语言模型,但人们对偏好数据的哪些属性驱动下游推理增益知之甚少。我们问:偏好对的哪些方面可以提高推理模型在一般推理任务上的性能?我们研究了偏好数据中质量增量的两个不同概念:生成器级增量,源于生成选择和拒绝推理轨迹的模型之间的能力差异;以及样本级增量,源于个体偏好对内判断质量差异的差异。为了研究生成器级增量,我们改变了生成器的规模和模型系列,为了研究样本级增量,我们采用 LLM 作为法官来评估沿多个推理质量维度生成的迹线的质量。我们发现,增加生成器级增量可以稳步提高域外推理任务的性能,并且通过样本级增量过滤数据可以实现更高效的数据训练。我们的结果提出了通过偏好优化来提高推理性能的双重方法:在构建偏好对时最大化生成器级增量,并利用样本级增量来选择信息最丰富的训练示例。