论文

串联可验证奖励强化学习

Tandem Reinforcement Learning with Verifiable Rewards

模型训练强化学习RLVR

摘要

可验证奖励强化学习(RLVR)显著改进大语言模型的推理能力——在竞赛数学等领域达到专家甚至超人表现。但更弱的智能体与人类能否真正利用该能力远不确定——RLVR已被记录使推理漂向特异模式——如可读性差与语言混杂。串联训练是近期针对该兼容性问题的范式:训练过的更强资深者与冻结的更弱初级者共同生成每个rollout——两者作为团队被奖励——因此资深者被推动以初级者能跟随的方式推理。但该范式迄今仅在概念验证设定中演示——能否扩展到现代RLVR管线的长思维链仍开放。本工作中——我们提出串联强化学习(TRL)——把串联训练范式带入RLVR。在TRL中——资深者与冻结初级者随机交替共同生成推理——所得生成被奖励——标准GRPO损失施加于资深者。在竞赛数学上训练Qwen3-4B-Instruct——我们发现TRL在单独推理能力上匹敌原始GRPO——同时三个性质从同一rollout结构共同涌现:与初级者的更强交接鲁棒性、自初级者的更小分布漂移——以及对初级者更可读的思维链。我们的结果展示了RLVR在多模型通信与人类兼容性上具有实际收益的有前景路径。

串联可验证奖励强化学习:论文配图
图 1:串联强化学习 (TRL) 概览。