论文

SAGE:调整参考分布以引导RLVR探索

SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs

模型训练强化学习RLVR

摘要

最近的研究发现,具有可验证奖励的强化学习(RLVR)可靠地提高了推理任务中的 pass@1,但通常无法在 pass@k 中产生可比的增益,这就提出了这样的问题:RLVR 是否真正使 大语言模型 获得新颖的推理能力,或者仅仅提高了基础模型中已有的采样推理模式的效率。先前的分析很大程度上支持后一种观点,将这种限制归因于标准 RLVR 目标的结构特性,导致勘探压力不足。在这项工作中,我们认为一个中心结构约束来自于反向 KL 正则化,它稳定了训练,但本质上将策略锚定到参考分布,从而抑制了替代推理模式的出现。然而,我们表明,删除 KL 项或用前向 KL 替换它都不能提供令人满意的解决方案,因为两者都通过引入 奖励作弊 或将概率质量分配给脱靶区域来破坏效率覆盖权衡。为了解决这种紧张关系,我们提出了 SAGE,这是一个原则框架,通过引导函数 q(x,y) 重塑反向 KL 锚分布本身,实现可控的经验支持扩展,从而在具有挑战性的数学推理基准上实现 pass@1 和 pass@k 的一致改进。我们的代码可在 https://github.com/tally0818/SAGE 获取。