论文

视觉中沿深度的动态模式分解 Transformer

Dynamic Mode Decomposition along Depth in Vision Transformers

模型评测模型行为与机制分析

摘要

最近的工作表明,连续视觉 Transformer (ViT) 块 (a) 可以用线性映射代替,(b) 组织成计算的循环阶段。我们问这些观察结果是否一致:ViT 深度是否实现了近似 \textit{自主线性} 动力学,允许单个运算符 $K$ 在连续跨度上循环应用?我们使用动态模式分解 (DMD) 对此进行测试,该分解从选定的连续隐藏状态对中拟合 $K$,并通过 $K^p$ 预测 $p$ 前进的步数。在四个预训练的 DINO ViT 上,我们研究了稳定拟合所需的正则化、排名和校准预算。对于短跨度 ($p \leq 4$),$K^p$ 在 DINOv3-H/16+ 上跟踪无约束端点映射到 $0.02$ 余弦相似度内,同时还在每个跳过的块处恢复中间激活。在早期的切割开始时,拟合算子会用最少的校准数据压缩到排名$\ll d$,并且跨标记,\texttt{cls}最适合线性化;这两个属性都随着深度单调衰减。然而,这种本地忠诚度并没有转移到下游。在最终的隐藏状态,在通过剩余的块传播之后,身份基线变得有竞争力。