论文

用于个性化偏好优化的梯度对齐配对选择

Gradient-Aligned Pair Selection for Personalized Preference Optimization

模型训练偏好优化

摘要

个性化大语言模型 (LLM) 需要将生成行为与用户特定的偏好而不是总体质量保持一致。虽然直接偏好优化 (DPO) 为偏好学习提供了稳定的框架,但其在个性化设置中的有效性关键取决于偏好对的选择方式。现有方法通常依赖于启发式标准,例如基于可能性的极端值,这将优化与显式用户效用脱钩,并可能导致个性化程度降低。通过分析预期用户效用梯度和 DPO 更新方向之间的一阶交互作用,我们将个性化偏好学习形式化为几何对齐优化问题。我们的分析表明,在离策略采样下,当偏好边际与效用梯度方向一致时,DPO 更新从纯粹的纠错信号转变为类似强化的更新。这种观点将配对选择视为一种几何决策,决定偏好优化是促进还是阻碍个性化。受这一见解的启发,我们提出了 GAP-DPO(几何对齐偏好 DPO),这是一种迭代算法,它执行效用感知、几何对齐对选择,同时通过历元再生控制分布转移。个性化文本生成基准实验表明,与标准 DPO 变体相比,GAP-DPO 持续提高了文体保真度、偏好对齐和生成质量。总之,我们的结果将梯度对齐确立为个性化偏好优化的统一原则,并证明配对选择是优化几何的内在组成部分,而不是启发式预处理步骤。