论文
情节:通过最佳传输增强偏好学习
PLOT: Enhancing Preference Learning via Optimal Transport
摘要
大语言模型 (LLM) 中的偏好学习取得了显着进展,但现有方法仍然受到性能增益有限、计算成本高、超参数敏感性以及全局 词元级 关系建模不足的限制。我们引入了 PLOT,它通过从最佳传输导出的 词元级 损失来增强基于 微调 的对齐中的偏好学习。通过将偏好学习表述为最优传输问题,PLOT 使模型输出与人类偏好保持一致,同时保留 LLM 的原始分布,确保稳定性和鲁棒性。此外,PLOT 利用词元嵌入来捕获语义关系,从而实现全局知情优化。跨越两个偏好类别(人类价值观和逻辑与问题解决)、涵盖七个子偏好的实验表明,PLOT 能够持续提高对齐性能,同时保持流畅性和连贯性。这些结果证实了最优传输作为偏好学习的原则方法,建立了一个理论基础框架,为 LLM 的偏好学习提供了新的见解。