关于自监督点云编码器对高效 3D 大语言模型 的功效
On the Efficacy of Self-Supervised Point Cloud Encoders for Efficient 3D Large Language Models
摘要
3D 点云语言模型 (3D-LLM) 通过将点云编码器与 大语言模型 配对来实现 3D 理解,但现有方法依赖于昂贵的多模态编码器(例如 ULIP-2),需要在 8x A100 规模的计算上进行图像-文本点云对齐,这给研究和部署带来了很高的障碍。在这项工作中,我们系统地研究低成本自监督点云编码器(特别是 PCP-MAE 和 Point-MAE)是否可以作为有效的替代方案。使用 MiniGPT-3D 作为我们的测试平台,我们在冻结和解冻 微调(总共 12 个组)下评估 7 个编码器初始化/预训练 设置(1 个多模式基线、5 个自监督、1 个随机初始化),跨 2 个架构(MaskTransformer、PointTransformer)、3 个目标(PCP-MAE、Point-MAE、随机初始化)和 2 个目标数据集(Objaverse 660K,ShapeNet55-34 约 50K)。我们的实验揭示了三个关键发现:(1)四阶段 MiniGPT-3D 管道可以有效地从随机初始化训练 3D 编码器:端到端训练的随机初始化编码器达到 52.50% 的开放词汇准确率和 44.45 的图像描述得分,接近顶级预训练变体; (2) 架构和 预训练 目标表现出很强的交叉交互作用:PCP-MAE + MaskTransformer 实现了 59.00% 的准确率(最佳自监督),而 Point-MAE + MaskTransformer 下降到 46.50%,与 PointTransformer 的模式相反; (3) 闭集 ModelNet40 分类仍然是纯几何编码器的核心弱点,即使在端到端 微调 之后,精度也仅达到约 13-18%,而多模态基线的精度为约 62%。我们的结果为经济高效的 3D-LLM 设计提供了实用指南,并揭示了自监督目标和编码器架构之间的交互模式。