论文

解码ViT中寄存器与高范数patch token的功能角色

Decoding the Functional Roles of Register and High-Norm Patch Tokens in Vision Transformers

模型评测模型行为与机制分析

摘要

DINOv2等自监督视觉transformer(ViT)学习丰富的视觉表示,但其内部token的功能仍不甚了解。近期架构引入专用寄存器token以减少背景区域涌现的高范数离群patch token,但两类token的语义与功能角色尚未完全确立。本文通过在DINOv2的寄存器token与离群token激活上训练稀疏自编码器(SAE)分析其角色:使用自动可解释性管道、UMAP聚类与CLIP空间交叉核验,我们发现寄存器token特征与高层语义概念关联更强;离群token特征则更常关联低层结构、背景与纹理主导的模式。因果消融进一步揭示实质性功能不对称:扰动激活最高的寄存器派生特征使表示余弦相似度下降48.17%,而扰动离群派生特征仅降0.31%。结果共同为自监督ViT中的token特化提供证据。