论文
Woodpecker蒸馏:弱模型诊断强模型的推理错误
Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models
摘要
大语言模型在解决推理任务时往往失败,尽管它们具备解决这些任务的能力。我们认为许多此类失败源于中间步骤中的局部推理错误,而不是全局的不胜任能力。我们展示了这些错误通常是可修复的:在相同的强模型前缀之后插入由弱探针模型生成的小补丁,可以引导模型的轨迹回到正确的解决方案。然而,这种纠正效果并不可靠地内化到直接微调弱补丁或修复后的路径上,暗示有用的信号不在于干预文本本身,而在于它如何重塑模型未来推理分布。因此,我们提出了木蠹鸟蒸馏(Woodpecker Distillation),这是一种从对比局部干预中学习的弱到强训练框架。我们的方法在相同的前缀处对比成功和失败的弱模型补丁,并从它们诱导出的未来令牌预测中构建纠正教师分布,然后将这个信号内化到强模型中。我们在数学推理基准上进行实验,结果表明木蠹鸟蒸馏显著提高了强模型的表现,并优于直接模仿基线。
