论文

原始生成,双重判断:从测试时间缩放进行自我训练

Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling

模型训练强化学习

摘要

代码生成通常在程序的原始空间中进行训练:模型生成候选解决方案并接收稀疏执行反馈,通常是单个通过/失败位。测试时间缩放通过对多个候选者进行采样并在其中进行判断来丰富推理过程,但该过程揭示的比较信息在推理后被丢弃。我们认为,这些信息定义了一个双重判断空间,提供了更丰富的训练信号:模型不是从孤立的成功或失败中学习,而是从其自身合理尝试的相对正确性结构中学习,识别哪些成功,哪些失败,以及它们的区别。我们引入 DuST(双重自我训练),这是一种从双重判断空间进行自我训练的框架。 DuST 从模型自己的分布中对候选程序进行采样,通过沙箱执行对其进行标记,保留包含成功和失败的组,并训练模型使用 GRPO 根据执行正确性对候选程序进行排名。其目标纯粹是判别式的:模型永远不会因为生成正确的程序而直接获得奖励。双重自我训练可以提高判断力和生成力。在跨越两个系列和三个规模(4B 到 30B)的五个模型中,DuST 持续改进了 LiveCodeBench 上的 Best-of-4 测试时间扩展。对于 LiveCodeBench v6 上的 Qwen3-30B-Thinking,判断质量提高了 +6.2 NDCG,单样本 pass@1 提高了 +3.1,Best-of-4 准确率提高了 +4.1。经过训练的模型的单次部署与基础模型的 Best-of-4 性能相匹配。对相同排名数据的 SFT 提高了判断力,但没有改进生成,证实了 同策略 RL 是将双空间学习转移回原始生成的机制。