论文

Tango3D:实现全局和局部 2D-3D 对应的一致性

Tango3D: Towards Alignment for Global and Local 2D-3D Correspondence

模型训练预训练

摘要

现有的 3D 基础模型通常将点云与 CLIP 等冻结视觉语言空间对齐,通过将 3D 形状压缩为全局向量来实现强大的跨模式检索。然而,这种仅全局对齐无法建立细粒度的像素到点对应关系。为了解决这个问题,我们提出了 Tango3D,这是一个统一密集对应和全局检索的基础模型。我们使用几何感知的 2D 视觉主干和预训练的 3D VAE 将图像编码为 2D 补丁,将点云编码为 3D 标记。它们被映射到单个共享空间中,以实现局部像素到点对齐和全局语义对齐。为了稳定密集和全局目标的联合学习,我们引入了三阶段渐进训练策略。实验表明,我们的模型成功实现了对象级像素到点对齐,同时保持有竞争力的全局检索,这是现有 3D 基础模型所不具备的联合功能。通过建立细粒度的对齐特征空间,Tango3D 将丰富的语义注入纯几何 3D 标记中,为广泛的密集 3D 下游任务铺平了道路。