论文

压缩-蒸馏:推理跟踪压缩以实现高效 知识蒸馏

Compress-Distill: Reasoning Trace Compression for Efficient Knowledge Distillation

模型训练合成数据

摘要

推理模型会产生很长的思想链痕迹,提炼和鼓励冗长的学生输出的成本很高。我们研究 知识蒸馏 之前此类痕迹的事后压缩。两位教师 Qwen3.5-397B-A17B 和 gpt-oss-120B 分别生成约 283k 条正确轨迹;然后,两个指令调整模型将它们压缩到原始字符长度的 8.6-21.0%。在 48 次运行的主网格加上 7 个 Qwen-teacher 截断消融中,压缩痕迹将训练标记减少到原始标记的 12-30%,将训练速度提高 2.0-7.6 倍,并将推理输出缩短 3-19 倍,在较短的 gpt-oss 教师下,减少幅度较小。然而,原始痕迹在每个尺度上以及对于两个教师来说都保留了最高的下游精度。长度匹配的原始轨迹截断表明,压缩不仅受益于较小的 词元预算:模型压缩轨迹通常击败或匹配朴素截断,特别是对于较小的学生,同时保持较短的推理输出。总体而言,推理轨迹压缩提供了准确性与效率的权衡,而不是免费改进:学生保留高达 96% 的原始轨迹准确性,同时获得高达 18 倍的每个标记效率,并且在 LoRA 压缩轨迹下的 0.8B 规模下,缩小了原始轨迹与压缩轨迹的差距,但不超过原始轨迹。