论文
PAR3D:具有用于场景理解的零件感知表示的统一 3D-MLLM
PAR3D: A Unified 3D-MLLM with Part-Aware Representation for Scene Understanding
摘要
3D 多模态 大语言模型 (3D-MLLM) 的最新进展为 3D 场景理解任务提供了统一的解决方案,包括视觉问答、字幕和引用分割。然而,现有的 3D-MLLM 在很大程度上仍然以对象为中心,限制了它们对细粒度零件结构进行建模的能力,而细粒度零件结构对于与 3D 环境的具体交互至关重要。在这项工作中,我们提出了 PAR3D,这是一个统一的零件感知 3D-MLLM 框架,使模型能够理解、推理和确定 3D 场景中的对象及其零件。为了实现零件感知 3D 场景理解的训练和评估,我们引入了 ScenePart,这是一个具有零件级注释和语言指令的合成 3D 场景数据集。我们进一步开发部件感知 3D 表示学习,以通过细粒度部件级语义丰富 3D 视觉表示,并提出分层分割查询生成,通过分层对象部件查询来接地部件目标。大量的实验表明,我们的方法极大地改进了部分级问答和引用分割,同时在对象级视觉语言任务中也实现了强大的性能。