论文

通过偏好弥合离线和迭代对齐之间的差距 蒸馏

Towards Bridging the Gap Between Offline and Iterative Alignment via Preference Distillation

模型训练偏好优化

摘要

直接偏好优化 DPO 是一种很有前途的离线对齐 大语言模型 (LLM) 方法,因为它简单、计算效率高,并且可以对人类偏好进行隐式建模。有趣的是,DPO 的迭代扩展在学术基准上取得了更强的表现,引发了两个关键问题:(i)为什么迭代方法通常优于离线方法? (ii) 它们的优势能否融入到线下比对中?为了回答第一个问题,我们的对照实验表明,在迭代过程中额外引入的显式偏好模型是其优于离线方法的关键因素。这一见解引导我们肯定地回答第二个问题,并提出蒸馏偏好概率策略优化(DP3O),一种有效且高效的离线对齐算法。 DP3O 首先使用 LLM 辅助类学习显式偏好模型,然后将其知识提炼为策略优化。从理论上讲,我们表明显式偏好建模比隐式公式具有更好的估计误差控制,并且 DP3O 通过方差减少实现了比硬标签 DPO 更严格的泛化界限。根据经验,我们在各种基于聊天的任务和下游任务上评估了 DP3O,并表明它优于最先进的离线方法,实现了与迭代 DPO 相当的性能,并将训练时间减少了约 42%$,证明了其有效性和效率。