论文

语言模型对齐的理论限制

Theoretical Limits of Language Model Alignment

模型训练偏好优化

摘要

语言模型 (LM) 对齐改进了模型输出以反映人类偏好,同时保留基础模型的功能。最常见的对齐方法是 (i) 强化学习,它在 KL 散度约束下最大化预期奖励,以及 (ii) best-of-$N$ 对齐,它在 $N$ 独立样本中选择最高奖励输出。尽管它们被广泛使用,但 KL 预算下奖励改善的基本限制仍然知之甚少。我们通过推导固定 KL 散度预算的最大可实现预期奖励增益来描述 KL 正则化对齐的信息论限制。我们的第一个结果提供了最佳奖励改进的封闭式表达式,由杰弗里斯散度项而不是先前分析中使用的 $\sqrt{\texttt{KL}}$ 控制。我们进一步将该表达式重新表述为基础模型下的协方差,产生一个实用的估计器,可以仅从基础模型样本中预测可实现的对齐增益。我们将分析扩展到代理奖励设置,结果表明理想对齐和代理对齐 (奖励作弊) 之间的差距随着奖励误差的大小以及 KL 惩罚因子的减小而增大。然后,我们证明奖励集成可以减轻 奖励作弊,为实践中使用的该技术提供理论依据。根据经验,我们计算了 LM 的两项任务(安全性和摘要)的 KL 奖励帕累托前沿,并表明 best-of-$N$ 接近理论极限,而 PPO 和 GRPO 仍然基本上是次优的。我们的理论结果揭示了对齐文献中几个凭经验观察到的现象,并表明需要改进算法才能在不增加推理成本的情况下实现最佳对齐。