论文

分布式直接偏好优化

Distributed Direct Preference Optimization

模型训练偏好优化

摘要

基于偏好的强化学习(RL)是使政策与人类判断保持一致的关键范式,但其在偏好数据分散在异构用户之间的分布式环境中的理论行为仍然知之甚少。直接偏好优化 (DPO) 避免了显式奖励建模,但缺乏联合和去中心化训练下的收敛保证,其中通信约束和非独立同分布偏好从根本上改变了优化动态。我们首次提供分布式环境中 DPO 的收敛性和时间复杂度分析。使用特定于用户的偏好分布对个性化离线强化学习进行建模,我们描述了诱导的全局优化景观。对于联合 DPO,我们得出收敛率,以量化客户端漂移、通信频率和偏好异质性的影响;对于去中心化 DPO,我们在一般通信图上建立了收敛,并展示了频谱连接如何控制优化速度和共识。根据经验,我们证实了我们对标准对齐基准的理论见解,证明我们提出的方法不仅享有强有力的理论保证,而且在实践中提供了稳健和可扩展的性能。代码库可在此处获取。