论文
ReAD:大语言模型 的强化引导能力 蒸馏
ReAD: Reinforcement-Guided Capability Distillation for Large Language Models
摘要
能力 蒸馏 将 知识蒸馏 应用于选定的模型能力,旨在将 大语言模型 (LLM) 压缩为较小的模型,同时保留下游任务所需的能力。然而,大多数现有方法将能力视为独立的训练目标,而忽视了提高一种能力如何重塑学生更广泛的能力概况,特别是当多种能力共同决定任务成功时。我们在固定的 词元预算 下研究能力 蒸馏 并识别出两种一致的模式:蒸馏 引起系统性的、依赖于预算的跨能力转移,额外的预算通常会带来有限的任务相关收益,同时有时会降低其他有用的能力。基于这些见解,我们提出了 ReAD,这是一个强化引导的能力 蒸馏 框架,它明确地考虑了能力的相互依赖性。 ReAD 首先推断任务关键能力,然后动态生成以能力为目标的监督,最后使用不确定性感知上下文老虎机根据预期效用收益自适应地分配 蒸馏 预算。大量实验表明,与强基线相比,ReAD 在相同的 词元预算 下提高了下游效用,同时减少了有害的溢出和浪费的 蒸馏 工作量。我们的代码可在 https://github.com/LabRAI/ReAD 上公开获取。