论文

论自我完善在线LLM对齐的收敛性

On the Convergence of Self-Improving Online LLM Alignment

模型训练偏好优化

摘要

自我改进对齐 (SAIL) 算法通过将问题的双层表述简化为高效的单层方法来解决分布偏移问题。根据经验,SAIL 在这项任务上表现出了强劲的表现。然而,缺乏对其收敛特性的正式分析。我们发现了一个关键的理论挑战:由于 Hessian 矩阵的不利特性,标准 SAIL 目标函数不能保证是强凹的。为了解决这个限制,我们提出了一个正则化目标 SAIL-RevKL,它结合了反向 Kullback-Leibler (KL) 散度惩罚来改善优化环境。我们的核心理论贡献是证明这个正则化目标满足有界参数空间内的 Polyak-Lojasiewicz (PL) 条件。我们建立全局收敛保证,实现近线性的样本复杂性。我们通过实证评估进一步验证了 SAIL-RevKL 的有效性和稳定性,证明它在 MuJoCo 基准和 LLM 对齐任务上都优于普通 SAIL。