论文
注意力转移对于视觉来说并不普遍有效 Transformer
Attention Transfer Is Not Universally Effective for Vision Transformers
摘要
最近的一项工作表明,注意力转移仅将注意力模式从预训练的教师 Vision Transformer (ViT) 转移到随机初始化的标准学生 ViT,足以恢复教师预训练权重的全部优势。我们对来自 11 个知名 ViT 家庭的 20 名教师进行了综合基准测试,重新审视了这一发现,结果表明注意力转移并非普遍有效。虽然有 7 个家庭成功转移,但有 4 个家庭始终失败,比从头开始的不转移基线低了 5.1%。进一步的结果表明,这种失败在不同模型大小之间是一致的,并且在延长的训练持续时间、不同的传输数据集和分布外评估下仍然存在。然后,受控分析一致地将问题定位到注意力路由通道,这表明关键问题不是学生是否能够匹配老师的注意力模式,而是匹配的模式是否对学生仍然有效。至关重要的是,我们将预先训练的教师和标准学生之间的架构不匹配确定为主要机制。通过仅将教师的原生架构组件添加到处于随机初始化状态的学生中,我们完全扭转了所有 4 个系列的失败。值得注意的是,这些组件本身并不能改善从头开始的训练,这证实了它们专门释放了教师注意力的可用性。我们进一步系统地表明,这种失败并不是由传输损耗选择不当或 预训练 配方的差异来解释的。我们的研究结果完善了对 ViT 表示中注意力的普遍理解:只有当学生架构与教师匹配时,注意力才足够。