更好的开始,更好的结束:用于压缩推理的引导迭代自我推理 蒸馏
Better Starts, Better Ends: Bootstrapped Iterative Self-Reasoning Distillation for Compressed Reasoning
摘要
大型推理模型通常通过长思想链(CoT)轨迹来解决问题,但大部分计算都花费在冗余推导、重复自我验证和绕道上,而这些并不能改善最终答案。现有的 同策略 自 蒸馏 方法通过将学生模型与从学生自己的生成轨迹中采样的前缀上的自身的简洁副本进行匹配来降低此成本。我们证明这个目标有一个初始化瓶颈。由于监督仅应用于访问过的前缀,因此从详细的基础模型进行训练会将 KL 损失置于通常有噪音、冗余或已经偏离轨道的上下文中。在这些区域中,简洁的教师只能提供局部修正,而学生则继续探索高效推理者应该避免的轨迹。在本文中,我们提出了 BIRD(Bootstrapped Iterative Self-Reasoning 蒸馏),这是一种两阶段自推理 蒸馏 方法,可改善 同策略 训练之前的 rollout 分布。 BIRD 首先在简洁指令下从基本模型中采样简洁的解决方案,仅保留答案正确的痕迹,并执行轻量级提示切换 SFT 步骤。这些痕迹是通过简洁指令生成的,但在原始任务提示下学习,将指令诱导的简洁性转变为默认的推理行为。从这个温暖的模型开始,BIRD 然后将 同策略 反向 KL 蒸馏 与简洁的自学工具一起应用,现在使用更干净、信息更丰富的前缀。在 Qwen3 系列模型中,BIRD 在 MATH-500 和 AIME 基准测试上实现了比提示和冷启动 同策略 蒸馏 更强的准确性与效率权衡。在 Qwen3-8B 上,它将 MATH-500 准确率从 86.2% 提高到 92.0%,同时将平均响应长度从 3,099 个标记减少到 1,115 个标记。这些结果凸显了前缀支持是高效推理 蒸馏 的核心因素。