论文

学习提示强化学习

Learning to Hint for Reinforcement Learning

模型训练强化学习

摘要

组相对策略优化(GRPO)广泛用于具有可验证奖励的强化学习,但它经常遭受优势崩溃:当组中的所有采样轨迹都获得相同的奖励时,该组产生零相对优势,因此没有学习信号。例如,如果一个问题对于推理者来说太难,则所有采样的采样轨迹都可能不正确并获得零奖励。最近的工作通过向此类难题添加提示或辅助支架来解决这个问题,以便推理器产生混合结果并恢复非零更新。然而,现有的提示通常是固定的,而不是适应当前的推理器,并且在提示输入下创建学习信号的提示不一定会改进测试时使用的无提示策略。为此,我们提出了强化学习的提示学习(HiLL),这是一个在强化学习期间联合训练提示策略和推理策略的框架。对于每个难题,提示器会根据当前推理器的错误采样轨迹在线生成提示,从而允许提示生成适应推理器不断变化的错误。我们进一步引入提示依赖,它衡量正确的提示轨迹对提示的依赖程度。我们得出的可转移性结果表明,较低的提示依赖意味着从暗示成功到无提示成功的更强转移,并且我们使用此结果来定义用于训练暗示者的转移加权奖励。因此,HiLL 倾向于提示,不仅可以恢复信息丰富的 GRPO 组,而且还可以产生更有可能改进原始无提示策略的信号。跨多个基准的实验表明,HiLL 始终优于 GRPO 和先前基于提示的基线,证明了 RL 的自适应和转移感知提示学习的价值。代码可在 https://github.com/Andree-9/HiLL 获取。