论文
LeVLJEPA:无负数的端到端视觉语言预训练
LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives
摘要
视觉语言预训练仍然以对比目标为主,而仅视觉自监督学习则主要采用非对比方法。与此同时,视觉语言编码器的角色也发生了转变:它们越来越多地不再被部署为零样本分类器,而是作为视觉语言模型和密集预测系统的冻结视觉主干,它们消耗完整的补丁标记网格,而不是单个池化嵌入。我们推出 LeVLJEPA,第一个完全非对比的端到端视觉语言预训练方法。 LeVLJEPA 通过具有停止梯度目标和按模态分布正则化的跨模态预测进行学习,无需负值、温度、动量编码器或师生时间表,并且可以大规模稳定训练。我们发现,生成的编码器为下游使用提供了明显更强的密集语义特征:作为冻结的视觉语言模型主干,LeVLJEPA 是在两种不同语言模型下的 GQA、VQAv2 和 POPE 中评估的最强编码器,并且在语义分割方面优于对比基线,同时在线性探测等全局读数方面保持同等水平。这些结果确立了非对比预训练作为产生密集语义视觉特征的有效手段。