论文
利用奖励的不确定性来诱导强化学习中的多样化行为
Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning
摘要
经典强化学习(RL)通常寻求一种确定性策略,使标量奖励的预期总和最大化。然而,现代应用程序(例如语言模型 微调 或科学发现)需要多样性。熵正则化或多样性奖金等现有补救措施通常需要脆弱的权衡,为了随机性而牺牲性能,或者依赖可能导致政策排名不一致的启发式指标。我们认为,多样性更自然地被理解为对奖励不确定性的理性反应。当奖励函数不完全已知时(例如偏好不明确或奖励模型不完善的情况),致力于单一行动可能不是最优的。在此基础上,我们提出了对 RL 目标进行根本性的重新表述,用奖励函数的分布替换标量奖励,并对一组动作应用非线性目标。结果是一个框架,其中校准的行为多样性自然出现,通过奖励函数分布保持可控,并且在不牺牲预期奖励的情况下获得。着眼于 大语言模型 (LLM) 后训练 中常用的上下文老虎机设置,我们为此目标导出了一个原则性的梯度估计器,并证明我们的公式自然地概括了普通策略梯度和最近开发的行动集方法。我们提供了补充我们理论结果的教学实验,并且我们在 LLM 推理中的大规模实证结果进一步证明,该框架为复杂的 RL 任务提供了一个稳健且有理论基础的替代方案,在这些任务中,问题的传统表述无法诱导所需的代理行为广度。