论文
根据人类反馈进行在线强化学习的数据依赖探索
Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
摘要
来自人类反馈的在线强化学习 (RLHF) 已成为通过在训练期间不断收集新的偏好反馈来对齐 大语言模型 (LLM) 的有前途的范例。此设置中的一个基本挑战是探索,这需要使 LLM 能够生成信息比较的算法,从而提高在线 RLHF 中的样本效率。现有的探索策略通常通过 同策略 期望获得奖励,而这些期望很难从训练期间可用的有限历史偏好数据进行可靠估计;因此,该政策可能会过早地降低可能包含高价值行为的未充分开发区域的权重。在本文中,我们提出了偏好优化的数据依赖探索(DEPO),这是一种简单且可扩展的方法,利用历史数据为高不确定性区域构建额外的不确定性奖励,鼓励对潜在高价值数据的探索。理论上,我们为所提出的算法提供了一个依赖于数据的后悔界限,表明它适应学习任务本身的难度,并且在实践中可以比最坏情况的界限更严格。根据经验,所提出的方法在各个基准测试中始终优于强大的基线,证明了样本效率的提高。