论文
通过随机选择的少样本指导,通过可验证的奖励促进强化学习
Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
摘要
具有可验证奖励的强化学习 (RLVR) 在开发 大语言模型 (LLM) 方面取得了巨大成功,并针对数学和编码等许多任务采样轨迹了思想链。然而,RLVR 在解决难以生成正确的 rollout 的难题时,在样本效率方面遇到了困难。之前的工作建议通过演示引导的 RLVR 来解决这个问题,即当 RL 失败时进行监督微调(SFT);然而,SFT 通常需要大量数据,而获取这些数据的成本可能很高。在本文中,我们提出了 FEST,一种 FEw-ShoT 演示引导的 RLVR 算法。仅从 SFT 数据集中随机选择 128 个演示,它就获得了令人信服的结果。我们发现三个组成部分对于成功至关重要:监督信号、同策略 信号以及少样本 SFT 数据集上的衰减权重,以防止多轮训练中的过度拟合。在多个基准测试中,FEST 的性能优于 SFT 数据量级较少的基线,甚至可以将其性能与完整数据集相匹配。