论文

JEM:可扩展的图像块级自监督学习

Scalable Patch-Level Self-Supervised Learning

模型训练模型架构应用与实践Transformer预训练视觉感知与空间理解

摘要

大规模自监督学习能够产生强大的视觉表征,但多数可扩展方法依赖多个目标与稳定机制的临时组合。我们重新思考能否设计既性能较好又有原则依据的自监督算法。从多视图假设出发,即任务相关内容由不同视图共有的信息承载,我们构建可分解为可解释项的信息论目标。由此得到JEM,一种学生—教师方法,通过对齐不同视图中的对应图像块表征学习,并以信息保持和结构保持损失进行显式正则化。JEM在300M到7B参数规模稳定训练;据我们所知,它是首个在7B规模验证的潜空间图像块级方法。在各规模上,JEM的全局与密集探针任务表现较强,在分割基准中持续超过DINOv2算法。DINOv2是当今较强视觉自监督方法的重要基础。尤其在7B规模,JEM的全景分割效果超过DINOv3,而训练数据仅为后者的1/12,并且没有细化训练阶段。结果说明,有原则依据且稳定的自监督算法可以学得较强表征。

JEM:可扩展的图像块级自监督学习:论文原图
图 2:从多视图 InfoMax 到 JEM。最大化等式中多视图 InfoMax 目标的变分下界。 2 产生两个要求:教师和学生分布 pp 和 qq 之间的跨视图对齐,以及信息丰富的非折叠目标 T∼q(⋅∣XT)T\sim q(\cdot\mid X_{T})。 JEM 通过三个损失项来实现这一点:KL 项 ℒalign\mathcal{L}_{\text{align}} 将学生补丁 ℓ\ell 与匹配的教师目标 m⁡(ℓ)m(\ell) 对齐; ℛglobal\mathcal{R}_{\text{global}} 通过边际熵和条件熵维护每个补丁的互信息; ℛstruct\mathcal{R}_{\text{struct}} 试图通过保留最终学生表示中 kk 层教师特征的几何形状来控制目标 TC⁡(T)\TC(T) 的总相关性。请放大查看详情。