论文
通过混合层 蒸馏 逐步关注关键信息来提高小模型的推理能力
Improving Reasoning Capabilities in Small Models through Mixture-of-Layers Distillation with Stepwise Attention on Key Information
摘要
大语言模型 的巨大计算需求增加了人们对通过思想链 (CoT) 蒸馏 将推理能力提炼为较小模型的兴趣。当前的 CoT 蒸馏 方法主要侧重于将教师生成的复杂推理原理转移到学生模型。然而,他们没有充分探索教师在推理过程中对关键信息的动态关注。我们发现语言模型在推理过程中表现出对关键信息的渐进注意力转移,这意味着得出结论的重要线索。基于这一观察和分析,我们引入了一种新颖的 CoT 蒸馏 框架,它将教师对关键信息的逐步注意力转移到学生模型上。这为学生在推理过程中逐步集中注意力于关键信息建立了结构化的指导。更重要的是,我们开发了一个混合层模块,可以实现动态对齐,以适应教师和学生之间的不同层。我们的方法在多个数学和常识推理数据集上实现了一致的性能改进。据我们所知,这是第一个利用 CoT 蒸馏 内的逐步注意力来改进小模型推理的方法。