论文
经验是最好的老师:激励LLM强化学习中的有效探索
Experience is the Best Teacher: Motivating Effective Exploration in Reinforcement Learning for LLMs
摘要
基于评分标准(rubric)奖励的强化学习(RL)近期在提升大语言模型(LLM)通用推理能力方面取得显著进展,但仍受困于局限于当前策略分布内的低效探索。事实上,RL优化可被视为将策略导向最大化奖励的理想分布,而有效探索应使投入的努力与期望目标对齐。利用这一洞见,我们提出HeRL,一个事后经验引导的强化学习框架,通过向LLM明确告知奖励中规定的期望行为来引导有效探索。具体而言,HeRL将失败轨迹及其未满足的评分标准视为事后经验,作为上下文内引导,促使策略探索超出其当前分布的期望响应。此外,我们引入奖励加成,以激励在此类引导下具有更大改进潜力的响应。HeRL促进从期望的高质量样本中有效学习,无需从零开始反复试错,并在理论上得到对期望梯度更准确的估计。跨多个基准的大量实验表明,HeRL相较基线取得更优的性能增益,并可在测试时进一步受益于经验引导的自我改进。我们的代码可在https://github.com/sikelifei/HeRL获取。
