论文
迭代纳什偏好优化的高效探索
Efficient Exploration for Iterative Nash Preference Optimization
摘要
偏好对齐对于改进 大语言模型 (LLM) 至关重要,但当人类偏好不可传递时,基于奖励的公式可能会受到限制。纳什从人类反馈中学习(NLHF)通过将对齐建模为偏好游戏并寻求纳什均衡来解决这一限制。然而,可扩展的 NLHF 的学习理论基础仍然有限:现有的后悔保证依赖于显式的偏好模型估计和极小极大预言,而更简单的迭代方法缺乏这样的保证。我们研究在线迭代 NLHF 并将探索视为一个关键障碍。首先,我们证明标准迭代 NLHF 可能会导致对逆 KL 正则化参数的指数依赖,这表明通过策略更新进行隐式探索可能是不够的。然后,我们提出探索性纳什偏好优化(ENPO),它将 SFT 型正则化与对抗性策略探索相结合。 ENPO 消除了这种指数依赖性,而不需要极小极大预言或显式偏好模型估计。我们进一步介绍 Bonus-Explorer ENPO (BENPO),它使用额外的预言机来实现 $O(\log T)$ 后悔界限。最后,我们开发了 Direct ENPO (DENPO),这是 微调 LLM 的 ENPO 的实用变体。 Llama-3-8B-Instruct 的实验表明,在多个基准测试中,评估的 RLHF 和 NLHF 基线得到了一致的改进。