论文
两种全球作物就足够了:在 DINO 式自我监督学习中定位语义出现
Two Global Crops Suffice: Locating Semantic Emergence in DINO-Style Self-Supervised Learning
摘要
用 DINO 式目标训练的自监督视觉转换器在视觉任务中表现出惊人的紧急语义表示质量,但这种行为背后的机制仍不清楚。我们对 DINO 家族进行了系统的实证剖析,并表明语义表示主要来自于加强同一图像实例的几何不同全局视图之间的一致性。这种特定于实例的全局对齐充当了 DINO 式学习的语义锚。在对语义对应和各种 2D 和 3D 下游任务进行评估的受控再训练实验中,我们发现补丁级掩蔽目标只有在与这种全局对齐联合训练时才能增强语义,这表明 iBOT 目标细化和致密了现有的语义结构,而不是独立创建它。相反,除了纯粹的全局对齐之外,局部到全局视图对齐并不能显着提高固定计算的语义质量。除了训练设计之外,我们还重新审视了如何评估语义表示质量:虽然分类准确性是标准验证分数,但语义对应提供了一个补充轴,可以更可靠地预测下游任务性能。总之,这些发现提供了 DINO 式学习的功能分解,并代表着理解语义表示如何在自我监督视觉模型中出现的重要一步。