论文

3D-PLOT-LLM:3D 大语言模型 的部分级对象标记

3D-PLOT-LLM: Part-Level Object Tokens for 3D Large Language Models

上下文与知识上下文工程

摘要

3D 多模态 大语言模型 (3D MLLM) 将 3D 对象描述为一个整体,但无法对其各个部分进行寻址、命名或推理。先前的部分感知尝试以大量参数成本添加分段解码器、更重的 3D 编码器或边界框语法。我们采取了一条根本不同的路径:我们重新组织输入词元流,以便可以通过 LLM 自己的词汇表直接寻址各个部分。我们的模型 3D-PLOT-LLM 将冻结点编码器的补丁划分为 K 个局部相关区域,并在每个区域的补丁标记之前插入可学习的每区域标记和保留词汇标记 <part_k>;然后,标记空间细化(MSR)模块根据其区域的空间统计数据和邻接邻居来调节每个标记。因此,该模型在其输出中引用零件,并遵循通过标记引用零件的提示,这是先前对象级 3D MLLM 所不具备的功能。为了探究这个接口,我们构建了 PartVerse-QA,这是一个词汇级的部分 QA 基准,改编自 PartVerse 网格注释(77K 训练对和关于不相交对象分割的 588 个保留查询),其中 3D-PLOT-LLM 达到描述到槽 Jaccard 0.459 和精确匹配 13.78%,槽到描述 GPT-4o 判断为44.68。在 3DCoMPaT-GrIn 零件感知有定位依据的描述基准上,3D-PLOT-LLM 在每个文本输出指标上均优于 PointLLM、Kestrel、PARIS3D 和 SegPoint,在 4 个指标中的 3 个指标上优于 ShapeLLM,与 PointLLM 相比,GPT-4o 判断高达 +3.03 GPT-4o。在 Objaverse 整体对象字幕上,在第 2 阶段添加 PartVerse-QA 会比 PointLLM 产生 +0.65 SBERT 和 +1.85 GPT-4o,并且在 5 个传统指标中的 4 个(SBERT、SimCSE、BLEU-1、METEOR)上超过 PointLLM-PiSA,尽管目标不同(部分基于)。所有这些都在冻结点编码器上具有低于 1M 的新可训练参数,比先前的部件感知 3D MLLM 低一个数量级,并且没有分段解码器或边界框头。