论文

有效地将语言模型与在线自然语言反馈结合起来

Efficiently Aligning Language Models with Online Natural Language Feedback

模型训练偏好优化

摘要

具有可验证奖励的强化学习已被用于在许多领域的语言模型中获得令人印象深刻的性能。但是,广泛有益的人工智能部署可能需要我们在“模糊”、难以监督的领域训练具有强大功能的模型。在本文中,我们开发了在模糊域中对齐语言模型的方法,其中人类专家仍然能够使用在线自然语言反馈提供高质量的监督信号,但仅限于少量模型输出。具体来说,我们通过迭代优化代理奖励信号、在过度优化点停止、收集新的专家监督并更新代理奖励来训练模型。我们使用上下文学习(ICL)和 微调 从语言模型构建代理奖励模型。我们通过分别在 Qwen3-8B 和 Haiku 4.5 中引出创意写作和对齐研究能力来测试我们的方法。对于 Qwen3-8B,ICL 方法在专家样本减少 50 倍的情况下恢复了高达 35% 的性能,而 微调 方法在样本减少多达 20 倍的情况下恢复了 80% 的性能,在样本减少 3 倍的情况下恢复了 100% 的性能。对于 Haiku 4.5,ICL 方法在样本减少 30 倍的情况下恢复了高达 35% 的性能,而 微调 方法在样本减少 10 倍的情况下恢复了 100%。我们的结果表明,在线自然语言反馈可以大幅提高专家监督的数据效率。