论文
超越最好的老师:扩展和压缩推理解决方案流形
Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold
摘要
一次强化学习运行可以产生一个强大的推理者,但却是一个不完整的老师:它通常只放大有效解决方案模式的一个子集。因此,我们认为,强化学习(RL)训练的策略应该被视为多流域推理解决方案流形的局部探索,而不是全局可靠的监管者。基于这一观点,我们提出了一个先扩展后压缩的框架,将教师建设与多教师政策 蒸馏 结合起来。在扩展阶段,残差组相对策略优化(RGRPO)从共同的初始化中训练一系列教师,并将后面的每一轮重定向到累积的教师联盟尚未涵盖的示例。在压缩阶段,可靠性门控教师联盟 同策略 蒸馏 (TU-OPD) 让学生从自己的响应前缀中学习。对于每个示例,只有可靠的教师做出贡献,并且他们的采样词元 OPD 损失根据每个示例的质量进行加权。我们进一步引入共识残差分解,它保留了获胜者教师相对于其可靠同行的过多词元偏好,防止专家行为在教师聚合过程中受到抑制。数学推理、代码生成和指令跟踪实验表明,Qwen3-1.7B 学生在所有三个领域的表现始终优于最强的个体教师,分别取得了 2.0%、8.3% 和 6.9% 的相对改进,同时保留了单模型推理能力。这些结果建立了一个简单但有力的原则:更强的学生不是通过选择一个更好的教师来获得的,而是通过刻意构建和压缩一个互补的教师联盟来获得的。