论文

MTA:大语言模型 蒸馏 的多粒度轨迹对齐

MTA: Multi-Granular Trajectory Alignment for Large Language Model Distillation

摘要

知识蒸馏 是压缩 大语言模型 (LLM) 的关键技术,但大多数现有方法在固定层或 词元级 输出上对齐表示,忽略表示如何跨深度演变。因此,在蒸馏期间,学生只能弱地被引导去捕捉教师的内部关系结构,这限制了知识迁移。为了解决这个限制,我们提出了多粒度轨迹对齐(MTA),这是一个沿着分层变换轨迹对齐教师和学生表示的框架。 MTA 采用层自适应策略:较低层在单词级别对齐以保留词汇信息,而较高层在短语级别跨度(例如名词和动词短语)上运行以捕获组合语义。我们通过动态结构对齐损失来实例化这个想法,该损失与每层内语义单元之间的相对几何形状相匹配。这种设计的动机是经验发现,即 Transformer 表示随着深度的增加而变得越来越抽象,并且也与通过较低级别词汇单元的组合出现较高级别含义的语言学观点相一致。我们进一步结合隐藏表示对齐损失来直接对齐选定的师生层。实验表明,MTA 在标准基准上始终优于最先进的基线,并通过消融确认了每个组件的贡献。