论文
无教师的自我训练会增强但不会复合:免费验证程序域上的 Pass@$K$ 交叉
Teacher-Free Self-Training Amplifies but Does Not Compound: A Pass@$K$ Crossover on a Free-Verifier Domain
摘要
当语言模型在其自己经过验证的输出上进行训练时,它是否获得了超出其基础的能力,或者只是更好地表达了基础已有的能力?我们通过一个无需教师的“星座”——一个生成器、一个有学问的批评者和一个免费的精确验证器——在 FlashFill 式的“活板门”DSL 上使问题变得可判定,其中经过验证的(问题、解决方案)对合成成本低,难以反转,并且可以免费精确检查。一切都在单个 24 GB GPU 上的一个 4 位 Qwen3-4B 上运行,循环中没有比基础模型更大的模型。我们报告了三项发现。 (i) 评论家指导的选择以 $+9.1$ pp($6/6$ 种子)击败了验证者过滤的 best-of-k$,整个增益集中在候选人对保留的输入意见不一致的任务上。 (ii) 每轮 STaR 自训练提高了上限,但从不加速——增益跟踪剩余的空间,并在 $K=4$ 独立训练轨迹上减速。 (iii) 该域没有干净的零能力边界,因此通常的“$0\%\to$climb$=$emergence”测试在这里无效。经过测量的 pass@$K$ 交叉可以确定诊断:经过训练的模型在运营预算 (pass@$8$) 上获胜,但基础在每个轨迹上都以大预算 (pass@$64$) 超越它,因此自我训练集中了概率质量而不是扩大范围。这是放大,而不是复利。 ($K=4$ 是指示性的,但还不是一个强大的跨轨迹 CI。)