论文

怎么开始就怎么推理:经前缀调优先验驱动RLVR探索

How You Begin is How You Reason: Driving Exploration in RLVR via Prefix-Tuned Priors

模型训练强化学习RLVR

摘要

带有可验证奖励的强化学习(RLVR)最近在大语言模型(LLM)推理任务中蓬勃发展。然而,奖励稀疏性和长推理范围使得有效的探索具有挑战性。在实践中,这一挑战表现为 \emph{熵崩溃} 现象,其中 RLVR 提高了单次推出的准确性,但未能扩大成功推理轨迹的覆盖范围。熵正则化等被动探索技术往往会忽视生成质量,从而导致推出时出现噪音。针对这个问题,我们提出了一个信息最大化增强探索(IMAX)框架来训练软前缀池,重塑基本模型的先验推理轨迹。每个前缀不是依靠 RL 来激励基本模型之上的探索,而是充当可训练的控制旋钮,从同一主干模型中引入不同的推出分布。为了鼓励发现多样化且与任务相关的推理行为,我们推导出信息最大化 (InfoMax) 奖励,以补充 RL 训练的可验证奖励。 IMAX 通常与算法无关,可以无缝集成到现有的 RLVR 流程中。实验结果表明,在三个主干尺度上,IMAX 相对于标准 RLVR 持续提高了推理性能,在 Pass@4 中增益高达 11.60\%,在 Avg@4 中增益高达 10.57\%。

怎么开始就怎么推理:经前缀调优先验驱动RLVR探索:论文配图
图 1:IMAX 框架概述。对于推理问题,冻结的LLM以学习的软前缀池为条件,其中不同的前缀引发不同的推理先验并导致不同的候选轨迹,例如代数、图解、类代码或符号解决方案。训练仅使用 RLVR 正确性奖励和 InfoMax 奖励更新前缀先验,鼓励前缀产生高质量且非冗余的推理轨迹。