论文
策略多样性自训练:让采样覆盖不同解法
Strategically Diverse Sampling for Self-Training
摘要
许多 LLM 训练和推理方法,包括强化学习和测试时间缩放,都依赖于重复采样,但只有当响应存在有意义的差异时才会受益。自我训练面临同样的挑战:训练数据通常是通过对 IID 响应进行采样并主要为了正确性进行过滤来构建的,从而过度代表了模型已经支持的策略。我们研究战略多样性,或者解决问题的方法之间的实质性变化,作为构建自我训练数据的替代原则。我们使用两种采样方法生成战略上多样化的数据:GROOT,一种构建方法层次树并对不同路径进行采样的新方法,以及语言化采样(VS),适用于生成一组非结构化方法。在竞争性编程和下一章节预测领域,在策略性采样数据上训练的模型在困难任务上的表现优于 IID 训练的模型,并为 RL 和测试时间扩展提供强大的初始化。最引人注目的是,对来自 Qwen3-4B 的策略多样但不正确的推理轨迹进行的自我训练优于来自 235B 教师的 IID 蒸馏。这些结果挑战了关于什么是有用的自我训练数据的普遍假设,并表明方法的多样性比正确性或教师规模更重要。
