论文
视觉变换器特征空间的任务诱导黎曼度量
Task-Induced Riemannian Metrics for Vision Transformer Feature Spaces
摘要
在 Vision Transformer (ViT) 特征空间上运行的方法通常依赖于欧几里德距离或余弦相似度。这假设每个方向都同样有意义,但没有理由相信真正的任务几何结构具有此属性。特征空间的任务敏感几何由回拉度量 $g(F) = J(F)^\top J(F)$ 给出,其中 $J$ 是相对于特征馈送至任务特定距离的解码器输出的雅可比行列式。在现代尺度下存储完整的 $g$ 是不可行的,并且对于诸如深度图之类的密集输出,甚至形成 $J$ 也是不切实际的。我们表明,是否可以学习该指标的低秩近似取决于模型-解码器对,并且我们用可通过少量雅可比向量乘积计算的无矩阵诊断 $\kappa_{cap}(r)$ 来表征这一点。对于易于处理的对,我们开发了频谱回调网络(SPN),它从随机幂迭代中学习度量的低秩版本,并将其提炼成 $310$K 参数重要性头,直接从特征预测词元重要性。当雅可比谱对于低秩近似而言过于分散时,将解码器的输入特征传递通过 VAE 瓶颈可以恢复易处理性。在 DPT、DINOv2、CLIP 和 VGGT 主干网络中,$\kappa_{cap}(r)$ 预测哪些学习度量架构是可行的。在 DINOv2 CLS 上,重要性头达到 Spearman $\rho = 0.998$,并且我们的几何标记剪枝将基于 ToMe 的标记选择的额外深度误差在剪枝率为 $0.5$ 的 DPT 深度上减少了 $25\%$,而无需微调 ViT。项目页面:此 https URL