论文

分布鲁棒的列表式偏好优化

Distributionally Robust Listwise Preference Optimization

模型训练偏好优化

摘要

面向语言模型对齐的既有鲁棒偏好优化主要研究成对监督——并将鲁棒性置于数据集、提示或偏好对层面。我们转而研究排名标签不确定性下的列表式偏好优化:给定提示与候选列表——观察到的列表内排名可能因标注者不一致、近平局、有损的逐位反馈或奖励模型噪声而含糊。我们提出逐点全变差鲁棒Plackett-Luce目标——直接在候选列表条件下鲁棒化排名标签。鲁棒损失可精确分解为名义PL损失加最坏情况PL修正——而最坏情况排名由将当前隐式分数升序排序获得——将内层最大化从K!枚举降至O(K log K)。这一可处理结构带来强离线与在线优化保证。在离线固定列表设定中——鲁棒目标为凸——投影随机次梯度以O(ε^-2)样本复杂度达到全局ε-次优。在候选列表由当前策略生成的在线策略诱导设定中——我们建立弱凸性与O~(ε^-2) Moreau包稳定点。离线LLM对齐实验表明所提鲁棒修正相对干净标签基本保持性能——并在噪声下提升鲁棒性。在线对齐中——它使奖励模型排名的候选扩展更可靠——并同时改进奖励模型与外部GPT-4裁判指标。