论文
视觉Transformer都需要register词元吗?跨架构复核
Do All Vision Transformers Need Registers? A Cross-Architectural Reassessment
摘要
视觉Transformer的注意力图可能出现伪影,影响可解释性。Darcet等人在2024年将这一现象归因于模型需要在CLS词元之外保存全局信息,并通过加入称为registers的空输入词元消除伪影、改善注意力图。本文复现这一研究,并在DINO、DINOv2、OpenCLIP和DeiT3上检查其结论的适用范围。实验支持其中若干主要判断,但一些判断不能普遍推广到其他模型。研究还考察模型大小,将分析扩展至较小模型,并澄清原论文的术语不一致及其对跨模型推广的影响。