论文
从稀疏到简单:通过稀疏注意力实现更简单的顺序替换 蒸馏
From Sparsity to Simplicity: Enabling Simpler Sequential Replacements via Sparse Attention Distillation
摘要
自注意力是大规模 Transformer 预训练的核心基础,但其二次词元交互成本使得推理成本高昂。用更简单的顺序模块取代注意力很有吸引力,但天真的替代通常是有损失的,尤其是在较大规模的情况下。本文通过稀疏性的视角重新审视了注意力替代。基于对 Transformer 层不同稀疏模式的观察,我们假设预训练的 Transformer 将词元之间的复杂词元依赖关系分解为不同复杂度的各种序列到序列映射,其中一些层功能可以被近似并替换为更简单的顺序模块而不会丢失。我们使用即插即用的分层 蒸馏 框架来评估这个前提,以近似和替换预训练视觉 Transformer 模型中的注意力功能。在固定训练预算下的受控分组替换揭示了一个清晰的模式:用稀疏注意力替换层所导致的准确度下降比替换更密集的层要小得多。我们进一步通过 AViT 风格的标记保留对预训练的 ViT 施加显式注意力稀疏性,并对顺序替换模型执行稀疏性引导的 蒸馏,其中我们看到教师稀疏性的增加持续减少了学生与教师之间的差距。该方法通过注意力稀疏性的指导,实现了有效的注意力替换,以减少参数大小和延迟。