论文

ROSS:通过选择性监督从自我生成的部署中重新学习

ROSS: Relearning from Self-Generated Rollouts through Selective Supervision

模型训练监督微调与指令调优

摘要

大语言模型训练后通过强化学习和策略上的蒸馏生成自生成的部署,但一旦策略取得进展,这种经验通常会被视为过时。历史rollout可以与后续策略保持兼容,同时保留策略不再可靠表达的行为。然而,它们也可能包含不应被模仿的错误、放弃的尝试和多余的行动,从而激发更细粒度的选择性监管。我们引入了 ROSS(通过选择性监督从自生成的rollout中重新学习),它保留了完整的历史轨迹作为上下文,同时仅将损失应用于选定的模型生成的延续。在特定领域的强化学习、多教师策略蒸馏和 Agentic 强化学习中,ROSS 持续改进上游检查点,并在数学、代码生成、指令遵循和软件工程方面超越基线。在 Qwen3.6-35B-A3B 上,ROSS 将六个基准 MOPD 平均值从 58.40% 提高到 62.20%,将 SWE 基准验证从 64.20% 提高到 68.40%。这些结果表明,自我rollout训练留下了可重用的行为经验,可以通过离线监督微调(SFT)产生进一步的收益,而无需额外的策略rollout。