论文

共享线性地图能走多远?探索图像编辑的特征空间可操作性

How Far Does a Shared Linear Map Go? Probing Feature-Space Manipulability for Image Editing

模型评测模型行为与机制分析

摘要

了解图像空间变换如何在模型的内部表示中体现是表示分析的长期目标。先前的工作表明,几何变换通常可以通过特征图之间学习的线性算子来捕获,但尚不清楚这是否扩展到光度、局部和语义定义的编辑。我们训练从空间共享线性映射到非线性每向量、感受野和全局 Transformer 模型的容量不断增加的探针,以预测由几何变换、光度编辑、遮挡和扩散生成的语义编辑引起的特征空间变化。在 ConvNeXt、SwinV2 和 DINOv3 中,单个共享线性图通常可以预测保留的操作结果,几乎可以预测出针对受监督主干网络的更具表达力的探针,并且充足性通常随着深度的增加而增加;对于 DINOv3,这种模式不太一致。这些结果表明,一个简单的空间共享线性算子通常足以表示不同的图像操作,而其主要奇异组件捕获语义内容,而更高阶的组件主要细化图像细节。我们将这些发现视为预测表征充分性,而不是内在线性特征空间几何的证据。