论文
GroupDPO:内存高效的分组直接偏好优化
GroupDPO: Memory-Efficient Group-Wise Direct Preference Optimization
摘要
偏好优化广泛用于使 大语言模型 (LLM) 与偏好反馈保持一致。然而,大多数现有方法在每个提示上训练单个正负对,丢弃通常包含多个候选响应的偏好数据集中可用的额外监督。受此限制的推动,最近的工作探索了分组偏好优化,它联合对比同一提示的多个响应,但由于分组耦合目标的内存开销,其经验行为和可扩展性仍未得到充分探索。在这项工作中,我们提出了针对群体偏好优化的统一实证和系统研究,并为群体耦合目标开发了一种内存高效的实现。通过使用特定于目标的每个响应系数实例化一阶线性化,我们的实现保留了一阶梯度,同时在反向传播期间解耦样本,大大减少了峰值内存使用量,并实现了更大组的可扩展训练。在离线和在线设置中,我们表明利用多个响应始终优于单对训练。此外,在积极响应中加入负对数似然(NLL)项对于性能提升和训练稳定性都至关重要。