论文
JEM:可扩展的图像块级自监督学习
Scalable Patch-Level Self-Supervised Learning
摘要
大规模自监督学习能够产生强大的视觉表征,但多数可扩展方法依赖多个目标与稳定机制的临时组合。我们重新思考能否设计既性能较好又有原则依据的自监督算法。从多视图假设出发,即任务相关内容由不同视图共有的信息承载,我们构建可分解为可解释项的信息论目标。由此得到JEM,一种学生—教师方法,通过对齐不同视图中的对应图像块表征学习,并以信息保持和结构保持损失进行显式正则化。JEM在300M到7B参数规模稳定训练;据我们所知,它是首个在7B规模验证的潜空间图像块级方法。在各规模上,JEM的全局与密集探针任务表现较强,在分割基准中持续超过DINOv2算法。DINOv2是当今较强视觉自监督方法的重要基础。尤其在7B规模,JEM的全景分割效果超过DINOv3,而训练数据仅为后者的1/12,并且没有细化训练阶段。结果说明,有原则依据且稳定的自监督算法可以学得较强表征。
