论文
从采样轨迹到训练方案:无需外部教师的大模型后训练
From Rollouts to Recipes: Self-Contained Post-Training for LLMs
摘要
后训练 大语言模型 通常对所有样本应用单一训练方案,即使模型自身的采样轨迹揭示了不同的样本级别学习状态。我们提出了 Self-Routing,这是一个行为条件 后训练 框架,它使用采样轨迹正确性和置信度来决定如何优化每个样本。根据其行为状态,样本被路由到 GRPO、同策略 自 蒸馏、正则化或跳过,从而允许训练适应而无需外部教师、额外注释或额外采样。跨 Qwen3 和 Qwen3.5 主干网的数学推理实验表明,自路由比统一 GRPO、统一 OPSD、固定混合和更简单的路由基线持续改进。进一步的分析表明,路由分布在训练过程中发生变化,并减少了对低信号或已经稳定的样本的不必要的更新。