论文
以对象为中心的LeJEPA
Object-centric LeJEPA
摘要
使用 LeJEPA 训练的图像编码器可以为下游任务提供强大的功能,但与其他图像级自监督方法一样,通常需要大型训练数据集。在对象级别而不是整个场景上对齐表示可以保证更高的数据效率,但是以完全自监督的方式做到这一点,有效地联合分区场景并表示其对象,是不稳定的:两者被锁定在循环依赖中,分区需要有意义的表示,而有意义的表示需要一致的分区。我们通过采用训练期间给定的对象掩模、使用廉价、现成的 SAM 方案来避免这种不稳定性。我们扩展了 LeJEPA(其分布式防崩溃目标自然地从整个图像移植到可变大小的对象集)以对齐以对象为中心的表示而不是整个图像。额外的实例分离损失将同一场景中的其他对象视为负数,进一步提高了下游性能。在两个模型尺度和 10-100% 的 COCO 中,对象级 LeJEPA 在跟踪 (DAVIS)、分类 (ImageNet-1k)、分割 (ADE20k) 和重新识别 (NAVI) 方面优于图像级 LeJEPA。