论文
DRY-SFT:通过不同解法的自监督微调提高多次尝试覆盖率
Don't Repeat Yourself: Self-Supervised Fine-Tuning for Coverage
摘要
在数学和编码等可验证领域,在多次尝试中找到一个正确的解决方案比每次尝试的通过率更重要。训练后可以将大语言模型输出集中在几种模式上,而提高采样温度的效果有限。我们引入了“不要重复自己的监督微调”(DRY-SFT),这是一种增加输出多样性和覆盖范围的后训练方法:在多次尝试中至少出现一个正确解决方案的概率。 DRY-SFT 有两个阶段。首先,对于每个问题,顺序生成 K 个解决方案,向模型显示所有先前的尝试并要求不同的解决方案。其次,独立地微调每次尝试,从上下文中删除先前的尝试。该过程不使用奖励、验证器或正确性过滤器。在 HumanEval+、MBPP+ 和 DS-1000 上,DRY-SFT 将 pass@100 分别提高了 10.8、12.5 和 12.4 个百分点,以很小的成本达到 pass@1。通过传递解决方案之间的抽象语法树编辑距离来衡量的结构多样性在所有三个基准测试中均显着上升。 DRY-SFT 还解决了基础模型在 200 次尝试中未解决的 600 个问题中的 244 个问题。在九个开放权重模型中,基础模型的较低结构多样性显着预测了较大的 DRY-SFT 增益,表明该方法对于模式崩溃较多的模型特别有效。