论文

混合策略蒸馏的推理压缩

Reasoning Compression with Mixed-Policy Distillation

摘要

以推理为中心的大语言模型(LLM)通过生成中间推理轨迹来实现强大的性能,但通常会导致过多的词元使用和较高的推理时间解码成本。我们观察到,在解决相同问题时,较大的推理模型通常可以产生更简洁的轨迹,而较小的推理模型往往会生成更长、更冗余的轨迹。这在实际部署中尤其成问题,因为内存、延迟和服务成本限制通常有利于较小的模型。我们的观察表明,推理压缩可以从大型模型转移到小型模型,而不是通过明确的长度约束来强制执行。基于这一见解,我们提出了混合策略蒸馏(MPD),这是一种推理压缩框架,通过蒸馏教师压缩的学生轨迹,将简洁的推理行为从体型较大的教师转移到体型较小的学生。与同策略蒸馏(在详细的学生轨迹上使学生与教师分布保持一致)或异策略蒸馏(依赖于教师生成的轨迹并可能遭受分布不匹配)不同,MPD 结合了两者的优点。给定学生采样的轨迹,教师将其重写为更简洁的推理轨迹,并通过基于 KL 的压缩轨迹对齐来训练学生。这保留了学生政策探索,同时注入教师指导的压缩。 Qwen3-1.7B 上的实验表明,MPD 将词元使用量减少了高达 27.1%,同时提高了多个推理基准的性能,展示了一种高效小模型推理的有效方法。

混合策略蒸馏的推理压缩:论文配图
图2:MPD总览:教师压缩学生轨迹后再蒸馏,迁移简洁推理行为。