论文
LLM 的混合策略 蒸馏
Hybrid Policy Distillation for LLMs
摘要
知识蒸馏 (KD) 是压缩 大语言模型 (LLM) 的强大范例,其有效性取决于分歧方向、优化策略和数据机制的相互交织的选择。我们分解了现有 KD 方法的设计,并提出了在它们之间建立联系的统一视图,将 KD 重新表述为 词元级 上的重新加权对数似然目标。我们进一步提出混合策略蒸馏(HPD),它集成了前向和反向KL的互补优势来平衡模式覆盖和模式搜索,并将离策略数据与轻量级近似同策略采样相结合。我们在长代数学推理以及短代对话和代码任务上验证 HPD,证明了跨不同模型系列和规模的优化稳定性、计算效率和最终性能的提高。与这项工作相关的代码可在 https://github.com/zwhong714/Hybrid-Policy-蒸馏 获取。