论文

只需8个token:经辅助分支的弱到强离策略强化学习

It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches

模型训练强化学习RLVR

摘要

带可验证奖励的强化学习已成为增强大语言模型推理能力的标准方法,通常通过对比多条自生成 rollout 来优化策略。但我们识别出该范式的一个关键支持集受限瓶颈:在困难的推理任务上,目标模型的采样常表现出语义冗余,收敛到相同的错误“推理盆地”,对策略更新几乎不提供奖励对比。本文提出以弱到强学习范式克服这一局限:让策略的探索由一个更弱但计算高效的辅助模型提供信息。我们提出W2SPO,一种离策略RL方法:向目标模型的中间轨迹注入通常短至8个token的辅助片段,目标模型再从这些被改变的状态继续完成推理路径;策略更新仅限于这些短插入段,依据最终可验证奖励进行。实验上,W2SPO在受评的4B规模模型中于数学推理基准上取得最佳表现,超过受评的后训练基线;在与原版GRPO相同的采样预算下,把Pass@1从62.3%提高到64.2%,同时获得3.55倍训练加速。这些结果表明,弱辅助分支能通过扩展局部探索支持集,诱导出更强的目标推理策略。

只需8个token:经辅助分支的弱到强离策略强化学习:论文配图
图 1:W2SPO 概述。标准 GRPO 依赖于目标模型的自我推出,这在语义上可能是冗余的,并且在困难的推理问题上会产生完全错误的推出组。 W2SPO 通过将短辅助分支插入中间目标模型前缀来本地扩展推出支持,然后让目标模型完成解决方案。验证者奖励分配给已完成的轨迹,而策略更新仅应用于短分支段。