论文
从RLHF到直接对齐:大语言模型偏好学习的理论统一
From RLHF to Direct Alignment: A Theoretical Unification of Preference Learning for Large Language Models
摘要
使大语言模型(LLM)与人类偏好对齐已成为安全且有益的AI部署的必要条件。虽然基于人类反馈的强化学习(RLHF)确立了主导范式,但大量替代方法——直接偏好优化(DPO)、身份偏好优化(IPO)、Kahneman-Tversky优化(KTO)、简单偏好优化(SimPO)等等——的涌现让实践者在方法选择上缺乏明确指引。本综述对偏好学习方法给出理论统一,揭示表面的多样性可归结为沿三个正交轴的原则性选择:(I)偏好模型(目标函数背后是何种似然模型),(II)正则化机制(如何控制与参考策略的偏离),(III)数据分布(在线与离线学习及覆盖要求)。我们以精确定义和定理对各轴进行形式化,建立若干关键结果,包括在线与离线方法之间的覆盖分离、奖励过优化的缩放律,以及直接对齐方法失效的条件。我们的分析揭示,失效模式——长度作弊、模式坍缩、似然位移——源于特定且可预测的设计选择组合。我们综合了50余篇论文的实证发现,并为实践者提供方法选择的决策指南。该框架将偏好学习从一门经验性技艺转变为有理论根基的学科。