论文
LLM 偏好调整的零阶范式
A Zeroth-Order Paradigm for LLM Preference Alignment
摘要
直接偏好对齐方法因其计算和内存效率而被广泛用于将大型语言模型 (LLM) 与人类偏好对齐。然而,似然位移激发了从似然裕度较小的偏好对中提取信息的替代方法。在本文中,我们提出并分析了基于比较的偏好优化(ComPO),这是一种基于比较预言的零阶对齐方法。 ComPO 从这些对中提取方向信息,而不直接优化它们的可微偏好损失。我们为其基本离线方案在平滑性、梯度稀疏性以及预言机与潜在目标之间的兼容性方面建立了收敛保证。我们进一步引入在线 ComPO,它保留了离线比较机制,并使用未标记的策略生成相对于参考策略进行反向 KL 控制。遵循偏好微调的覆盖视角,我们在局部覆盖和分布内成对奖励精度下为基本约束方案建立了性能保证。 Mistral、Llama、Gemma-2、Qwen3 和 Gemma-3 模型的实验证明了对现有直接对齐方法的改进,包括长度控制的获胜率,并且配对水平诊断提供了与减轻似然位移一致的证据。