论文
MAG-3D:用于 3D 理解的多智能体基础推理
MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding
摘要
视觉语言模型 (VLM) 在多模态理解和推理方面取得了出色的表现,但 3D 场景中的基础推理仍处于探索之中。有效的 3D 推理取决于准确的基础:为了回答开放式查询,模型必须首先识别复杂场景中与查询相关的对象和区域,然后推理它们的空间和几何关系。最近的方法已经证明了扎根 3D 推理的强大潜力。然而,它们通常依赖于域内调整或手工制作的推理管道,这限制了它们对新环境的灵活性和零样本泛化。在这项工作中,我们提出了 MAG-3D,这是一种 无需训练 多智能体框架,用于使用现成的 VLM 进行扎根 3D 推理。 MAG-3D 不依赖特定任务的训练或固定推理程序,而是动态协调专家代理来解决 3D 推理的关键挑战。具体来说,我们提出了一个分解任务并协调整个推理过程的规划代理,一个从广泛的 3D 场景观察中执行自由形式 3D 基础和相关帧检索的基础代理,以及一个通过可执行程序进行灵活的几何推理和显式验证的 编码智能体。这种多智能体协作设计可实现跨不同场景的灵活 无需训练 3D 推理,并在具有挑战性的基准测试中实现最先进的性能。