论文
ARKD:用于文本生成的自适应强化学习引导双向 KL 散度 蒸馏
ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation
摘要
知识蒸馏 (KD) 是压缩 大语言模型 (LLM) 的关键技术,但依赖于单个 KL 目标的方法通常无法平衡一次分布拟合与长尾概率建模,从而限制了生成质量和泛化能力。为了解决这个问题,我们从理论和实证的角度分析了正向和反向 KL 散度(FKL/RKL)在分布对齐中的互补作用。然后,我们提出了一种基于强化学习的自适应KL加权蒸馏框架,其中策略网络根据师生分布特征动态为FKL和RKL分配权重,在即时奖励信号的引导下实现主体和长尾模式的双重对齐。大量实验表明 Rouge-L 和 BertScore 指标得到了一致的改进,比贪婪启发法高出 0.4-0.6 个点,并且在不同的基准测试中优于其他基线方法。