论文

Cross4D-JEPA:用于 4D 点云表示学习的密集跨模态对应 蒸馏

Cross4D-JEPA: Dense Cross-modal Correspondence Distillation for 4D Point Cloud Representation Learning

模型训练预训练

摘要

自动理解动态 4D 点云(由深度传感器和 LiDAR 随着时间的推移捕获的 3D 点序列)是机器人技术和具体感知的核心。然而,对它们进行密集注释的成本很高,这使得自监督预训练成为可转移表示的自然途径。然而,现有的借口任务几乎完全是模内的,并且从 2D 基础模型转移知识的少数方法依赖于每个剪辑的单个全局嵌入,丢弃了这些模型计算的丰富的每个补丁语义。为了解决这一差距,我们提出了 Cross4D-JEPA,这是一种师生方法,可将冻结的 2D 基础模型、图像模型 DINOv2 或视频模型 V-JEPA 2 提炼为 4D 点编码器。所提出的方法结合了(1)密集的跨模态对应,将每个 3D 点映射到其投影到的教师补丁特征,以及(2)每点目标,训练学生在潜在空间中匹配这些特征,而无需掩蔽、底片或解码器。我们根据模内和全局跨模态基线,在四个基准(MSR-Action3D、DeformingThings4D、NTU-RGB+D 60 和 HOI4D)上评估 Cross4D-JEPA。实验结果表明,在匹配的协议下,所提出的方法在四个基准测试中始终优于模内和全局跨模态基线,并且与较重的已发布的 4D 方法具有竞争力;进一步的分析将这种收益主要归因于对应的粒度而不是教师的方式。除了识别准确性之外,Cross4D-JEPA 学习的密集表示可以跨域传输,提高标签效率,并在相同的训练预算下改进全标签 微调,而小 13 倍的编码器与重量级池化主干相匹配。