论文
走向解开的偏好优化动态:抑制失败者,保留胜利者
Towards Disentangled Preference Optimization Dynamics: Suppress the Loser, Preserve the Winner
摘要
偏好优化广泛用于使 大语言模型 (LLM) 与人类偏好保持一致。然而,许多基于边际的方法在试图抑制被拒绝的响应时也会抑制所选的响应,并且没有通用的方法可以跨不同的目标防止这种情况发生。我们通过偏好优化的统一激励得分分解来解决这个问题,揭示不同的目标共享相同的局部更新方向,仅标量权重不同。这种分解提供了一个通用框架,用于分析以前在单独设置中研究的目标。在此分解的基础上,通过分析选择/拒绝可能性的动态,我们确定了解缠带(DB),这是一个简单的、可测试的条件,它告诉我们训练何时可以遵循期望的路径:抑制失败者,同时保留获胜者,可能是在早期阶段之后。使用数据库,我们提出奖励校准(RC),这是一种即插即用的方法,可以自适应地重新平衡所选和拒绝的响应的更新以满足数据库,而无需重新设计基本目标。经验结果表明,RC 会导致更加解缠结的动态,并且在多种设置中观察到更好的下游性能。我们的代码可在 https://github.com/IceyWuu/DisentangledPreferenceOptimization 获取。