论文

SRA:大语言模型 蒸馏 的跨度表示对齐

SRA: Span Representation Alignment for Large Language Model Distillation

摘要

交叉分词器 知识蒸馏 (CTKD) 可以在 大语言模型 和较小的学生之间进行知识转移,即使他们使用不同的分词器也是如此。虽然现有方法主要关注 词元级 对齐策略,这些策略通常很脆弱并且对标记器之间的差异敏感,但我们认为在 蒸馏 之前将标记聚合成更鲁棒的表示的方法同样重要。在本文中,我们介绍了 \textbf{SRA} (\textbf{S}pan \textbf{R}representation \textbf{A}lignment for 大语言模型 蒸馏),这是一种通过多粒子动力学系统的物理镜头重构 CTKD 的新颖框架。 SRA 将对齐的基本单位从标记转变为健壮的、与标记器无关的跨度。我们将每个跨度建模为一组粒子,并通过其质心(CoM)表示其状态——这是一种捕获丰富语义信息的注意力加权平均值。我们利用跨质心的概念和注意力衍生权重来优先考虑最显着的跨度。此外,我们采用几何正则化器来保持表示空间的结构完整性,并引入对齐跨度 logits 蒸馏 来增强跨模型的知识传递。在具有挑战性的跨架构 蒸馏 实验中,SRA 始终显着优于最先进的 CTKD 基线,验证了我们基于物理的方法。