论文

跨架构底层:现代视觉编码器的超越领域、校准后的几何不变量

The Cross-Architecture Substrate: A Domain-Transcendent, Calibration-Surviving Geometric Invariant of Modern Vision Encoders

模型评测模型行为与机制分析

摘要

不同的视觉神经网络——经过训练来分类、对比、重建或匹配图像与文本——应该有相应不同的内部表示。我们报告说他们没有。经过训练,13 个现代视觉编码器内的前 16 个主要变化方向收敛到同一个 16 维几何对象。我们将其称为跨架构基底,并使用 PCA、居中内核对齐 (CKA) 和 Pang 2026 校准对其进行研究。该基质以中值 Procrustes-CKA 0.679 跨四个视觉域(自然照片、医学 CT、卫星、显微镜)传输,以 0.604 跨八个域(添加草图、深度、热红外、天文学)传输,每对 >0.40。它在全局(7.4x 盘与 MAE 分离,n=13,394)和局部(4.82-5.30,p<10^{-44})中幸存下来。它不是像素统计 (0.263),不是 Gabor 特征 (0.31),也不是随机投影 (0.041),并且出现在训练的前 10% 中,而准确率不断攀升。我们提供四种应用:优于 LogME 的无标签可转移性过滤器(速度快 3 倍,+0.15 Kendall-tau);四路域检测器(准确度 99.6%);冻结的低射探针(16 暗淡比 768 暗淡 DINOv2 快 3.78pp,每类 N=50 个标签);以及无教师的 蒸馏 辅助匹配训练有素的教师 KD 33 对(10% 标签分数时峰值增益为 7.56pp)。该基质不跨模态,无助于跨范式蒸馏,并且不预测转移质量(相对于转移精度,rho=0.08)。