论文
LEAP:分层退出感知预训练,实现高效 Transformer 推理
LEAP: Layer-wise Exit-Aware Pretraining for Efficient Transformer Inference
摘要
层对齐的 蒸馏 和基于收敛的提前退出代表了 Transformer 推理的两种主要计算效率范例;然而我们发现,它们在基于融合的提前退出的标准部署条件下表现出系统不兼容性。将中间学生层与教师表示对齐的 蒸馏 目标会抑制提前退出机制利用的表示收敛,从而使此类机制在蒸馏模型上无效。我们引入了 LEAP(分层退出感知预训练),这是一种辅助训练目标,可以解决这种不兼容性。 LEAP不需要架构修改;它通过单个约束增强了标准 蒸馏,确保中间层近似最终层表示。 LEAP-MiniLM 在 $θ$=0.95 时实现了 1.61$\times$ 测量挂钟加速(批次=1,NVIDIA L4),其中 91.9% 的样本通过第 7 层退出,理论层数减少了 1.80$\times$,其中标准蒸馏模型实现了零有效加速。我们跨句子相似性(STS-B:0.760 $\pm$ 0.006)和检索基准(BEIR)进行验证,提供操作指导,包括延迟测量、决策阈值和部署标准。