论文
3D-MRL:通过 Matryoshka 表示学习的嵌套多模态 3D 表示
3D-MRL: Nested Multimodal 3D Representations via Matryoshka Representation Learning
摘要
视觉语言模型将点云与图像和文本嵌入对齐,从而实现 3D 形状的零样本识别、检索和开放词汇理解。现有的多模态 3D 预训练 方法产生固定维度的嵌入,需要针对不同的计算预算使用单独的模型。我们提出了 3D Matryoshka Representation Learning (3D-MRL),这是一种基于 Matryoshka Representation Learning 的多模态 3D 预训练 框架。 3D-MRL 通过将点云与冻结的 CLIP 图像和文本嵌入对齐来学习嵌套 3D 表示,同时在多个嵌入维度上应用对比监督。 Matryoshka 目标仅应用于 3D 编码器,允许单个模型生成不同维度的表示,而无需重新训练。在 Objaverse-LVIS、ModelNet40 和 ScanNet 数据集上的实验表明,3D-MRL 在零样本和少样本 3D 识别任务上实现了有竞争力的性能。此外,学习到的表示支持在单个模型中跨不同嵌入维度进行检索。在 Objaverse-LVIS 上,3D-MRL 将 Top-1 准确率从 46.8% 提高到 50.9%。检索实验进一步表明,不同的嵌入维度会产生不同程度的语义和几何特异性。