论文
ShortOPD:用从短到长的同策略蒸馏恢复剪枝模型
ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation
摘要
结构化剪枝便于硬件加速,但常用多选任务验证,剪枝后的同一模型在部署所需的自由生成中可能崩溃。论文观察到,压缩后贪婪pass@1几乎消失,多次采样的pass@k却能显著恢复,说明有效生成概率下降而非能力完全消失;可恢复状态的主要失败来自后缀重复。因此,恢复应在压缩模型自身采样状态上使用密集词元监督。同策略蒸馏OPD以压缩前冻结模型为教师提供这一监督,但长采样轨迹会将早期预算耗费在低信息重复后缀。 ShortOPD采用从短到长的调度,检测教师确认的重复后缀,将剩余前缀作为各轨迹有效长度,并据此分配未来采样预算。在数学、代码和开放生成实验中,恢复后得分约为未恢复模型的9倍、标准恢复方案的1.6–4.4倍;与固定8192词元采样长度相比,得分差距不超过两点,训练时间为8.5小时对35.9小时,采样词元减少71%。标准对照包括不使用知识蒸馏的SFT、KD与SeqKD。作者希望推动结构化剪枝从困惑度和多选评测走向更可靠的实际生成。