论文

Chat-Scene++:利用上下文丰富的对象识别进行 3D LLM

Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM

上下文与知识上下文工程

摘要

多模态 大语言模型 (MLLM) 的最新进展显示出 3D 场景理解的强大潜力。然而,现有方法在细粒度对象基础和上下文推理方面存在困难,限制了它们解释复杂 3D 环境并与之交互的能力。在本文中,我们提出了 Chat-Scene++,这是一个 MLLM 框架,它将 3D 场景表示为上下文丰富的对象序列。通过将场景构建为具有上下文语义的对象序列,Chat-Scene++ 实现了以对象为中心的表示和交互。它将 3D 场景分解为与标识符标记配对的对象表示,从而允许 LLM 遵循跨不同 3D 视觉语言任务的指令。为了捕获对象间关系和全局语义,Chat-Scene++ 使用大规模预训练的 3D 场景级和 2D 图像级编码器提取上下文丰富的对象特征,这与 Chat-Scene 中孤立的每个对象特征不同。其灵活的以对象为中心的设计还支持扎根思想链(G-CoT)推理,使模型能够在多步推理过程中区分类别和空间级别的对象。无需额外的特定任务头或 微调,Chat-Scene++ 在五个主要 3D 视觉语言基准测试中实现了最先进的性能:ScanRefer、Multi3DRefer、Scan2Cap、ScanQA 和 SQA3D。这些结果凸显了其在场景理解、物体基础和空间推理方面的有效性。此外,我们无需通过计算成本高昂的过程来重建 3D 世界,仅使用 2D 输入即可证明其对现实场景的适用性。