论文

具有低秩分解的语言模型的多方面 知识蒸馏

Multi-Aspect Knowledge Distillation for Language Model with Low-rank Factorization

摘要

知识蒸馏 是一种有效的预训练语言模型压缩技术。然而,现有方法仅关注各层之间的知识分布,这可能会导致对齐过程中细粒度信息的丢失。为了解决这个问题,我们引入了多方面 知识蒸馏 (MaKD) 方法,该方法更深入地模仿自注意力和前馈模块,以捕获不同方面丰富的语言知识信息。实验结果表明,与具有相同存储参数预算的各种强基线相比,MaKD 可以实现具有竞争力的性能。此外,我们的方法在提取自回归架构模型方面也表现良好。