论文

Le MuMo JEPA:具有可学习融合词元的多模态自监督表示学习

Le MuMo JEPA: Multi-Modal Self-Supervised Representation Learning with Learnable Fusion Tokens

模型训练预训练

摘要

自监督学习已成为学习视觉表示而无需手动注释的强大范例,但大多数方法仍然在单一模式上运行,因此错过了异构传感器可用的补充结构。我们提出了 Le MuMo JEPA,这是一个自监督框架,可以从 RGB 图像和对齐的伴随模态中学习统一的表示。在我们的驾驶实验中,第二种模式是相机对齐的 LiDAR 深度;我们还评估了 Teledyne FLIR ADAS 基准上的 RGB 热训练和传输。我们的方法通过学习融合标记将 LeJEPA 扩展到多模态设置,这些融合标记充当共享 Transformer 内特定模态补丁干之间的潜在瓶颈。我们的默认模型采用修剪融合策略:在初始跨模态注意层之后,特定于模态的标记被丢弃,在将草图各向同性高斯正则化(SIGReg)应用于联合多模态 CLS 嵌入之前,迫使跨模态信息进入共享融合标记网格作为有效的潜在瓶颈。在 Waymo 上,Le MuMo JEPA 在从头开始的多模态基线中对下游补丁探针提供了最强的性能效率权衡,改进了 CenterNet 检测和密集深度,同时在分割方面保持竞争力。在 nuScenes 上的从头开始训练中,Le MuMo JEPA 仍然是最强的模型,并且它还给出了最好的 FLIR 结果,特别是在 Waymo 初始化 微调 之后。它还在我们的研究中以显着较低的计算、内存和估计训练时间保持了最佳的整体准确性-效率平衡。