论文

剩余优势:学生相对教师对 RL 的指导和可验证的奖励

Residual Advantage: Student-Relative Teacher Guidance for RL with Verifiable Rewards

模型训练模型优化强化学习蒸馏

摘要

具有可验证奖励的强化学习(RLVR)和策略蒸馏(OPD)已成为训练后推理模型的两个主要范例。 RLVR 为每个响应提供一个结果标签,其中的步骤没有单独的标注。 OPD 对学生访问的前缀提供标记级别的指导,但其逐点信号并不能直接反映教师与学生在词汇方面的分歧模式。密集的、无界的对数比监督可以放大教师的影响力,但当学生的解决方案路径偏离教师的路径时,强大的求解器不一定是合适的指导。我们提出残差优势(\RA{}),它将教师-学生概率残差视为有界的一步奖励,减去学生策略下相应的状态值以形成标准优势,并将结果集中在每个响应中,然后将其添加到验证者优势中。每个响应中的指导术语均值为零,因此验证者优势仍然是响应的均值标签,并且教师仅在之间重新分配信用 其中的步骤。 \CoRA{} 进一步更新教师 LoRA,并在同一评分学生批次上具有验证者优势,并在下一次迭代的残差中使用更新后的教师,从而根据学生的尝试调整指导。在 Qwen3-1.7B-Base 和 Qwen3-4B-Base 学生以及 Qwen3-8B 教师的帮助下,\RA{} 与 GRPO 或 REINFORCE++ 相结合,在三个数学基准的所有 24 次比较中改进了底层序列优势算法,将宏 Avg@8 提高了 1.7--3.6 分,将 Pass@8 提高了 3.9--6.3 分。两种组合都超过了仅教师的 OPD,并且 \CoRA{} 进一步增加了 1.0--1.5 Avg@8 分。