SiamJEPA:论暹罗学生编码器在 JEPA 中的作用
SiamJEPA: On the Role of Siamese Student Encoders in JEPA
摘要
联合嵌入预测架构(JEPA)已成为一种有前途的自监督表示学习框架,通过预测屏蔽区域的潜在嵌入而不是重建像素。现有的 JEPA 方法通常采用单个学生编码器,而暹罗学生编码器的作用在很大程度上尚未被探索。在本文中,我们提出了 Siamese JEPA (SiamJEPA),这是一个带有屏蔽 Siamese 学生编码器和指数移动平均 (EMA) 教师的 JEPA 框架,它也可以被视为受大脑启发的表示学习模型 PhiNet 的 JEPA 公式。我们进一步引入了随机洗牌教师(RST),它消除了教师目标中的空间对应以鼓励语义补丁表示,并开发了基于 RST 的语义到空间课程。 ImageNet 上的实验表明,Siamese 学生编码器有效地规范了 JEPA 目标,提高了表示可分离性并加速了早期学习。此外,在 RST 下,更强的 Siamese 正则化大大增加了各个补丁标记中的类判别信息,这表明语义偏差来自 RST 和 Siamese 目标之间的交互,而不是单独的洗牌。在有限的训练预算下,SiamJEPA 的性能始终优于同类单编码器 JEPA 变体。通过基于 RST 的课程学习和 ViT-Base 主干,SiamJEPA 使用简单得多的掩蔽策略在 450 个 epoch 后实现了 74.2% 的线性探测精度,而与 I-JEPA (72.9%) 和 DSeq-JEPA (73.5%) 在 600 个 epoch 后相比。这些结果表明,连体学生编码器为预测表示学习提供了有效的归纳偏差,并且可以通过语义到空间课程学习进一步增强。源代码可在 https://github.com/oist/SiamJEPA 上公开获取。