论文

自我验证的 蒸馏:你的语言模型秘密地是它自己的合成数据管道

Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline

模型训练合成数据

摘要

训练后的 大语言模型 (LLM) 是否可以仅使用未标记的提示,在没有外部教师或工具反馈的情况下进一步提高自己?我们仅从没有 真值 解决方案的未标记种子问题开始研究此设置,跨越三个推理领域:数学、科学和编码。我们提出了自我验证 蒸馏,这是一种简单的 后训练 细化算法,其中模型生成这些种子问题的候选解决方案,使用基于提示的自我验证对其进行过滤,并在生成的自我管理数据集上进行训练。受到昆士兰大学基准测试使用多个验证器来筛选未解决的难题的候选答案的启发,我们将这种基于验证的过滤思想应用于自我训练:模型通过循环一致性、事实性和正确性检查的三阶段级联来过滤自己生成的解决方案,只有在法官一致投票通过所有阶段的解决方案时才接受解决方案。我们发现,在训练数据构建过程中对更多候选代进行采样并使用更大的验证预算会产生更高质量的自我管理数据,进而产生更好的推理模型。然后,我们使用自我验证的 蒸馏 在多个尺度上训练 Qwen3 模型,并获得所有三个领域的增益。对于 Qwen3-4B,我们的方法将数学(AIME26 和 HMMT)中的总保留 pass@1 提高了 +16.7 分,科学(GPQA Diamond 和 HLE)提高了 +11.1 分,编码(LCBv5 和 LCBv6)提高了 +8.3 分,增益也扩展到了 0.6B 和 8B 模型。与我们的仅测试时基线 (UQ-TTC)(通过在推理时花费额外计算来提高性能)相比,自验证 蒸馏 在大多数设置中实现了更好的性能,同时在测试时只需要一次推理调用。