论文
ViewMind3D:无需训练 3D-QA 的模块化视图感知推理
ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA
摘要
大语言模型 (LLM) 和视觉语言模型 (VLM) 的最新进展为 3D 问答 (3D-QA) 带来了新的可能性,这是实体人工智能和机器人感知的关键功能。然而,大多数现有方法依赖于 3D 特定训练或带有昂贵注释的 微调,限制了它们的可扩展性和实际适用性。我们提出了 \textbf{ViewMind3D},这是一个完全的 无需训练 和模块化框架,用于对场景的多视图观察进行 3D 空间推理,而不需要完整的 3D 重建。该框架将 3D-QA 任务分解为四个可解释的组件:(1) 问题驱动的多视图选择,(2) 使用语言条件对象线索引导视觉基础,(3) 通过鸟瞰图 (BEV) 视点指示器进行空间上下文编码,以及 (4) 通过基于角色的推理生成结构化答案。这种设计无需模型调整即可实现结构化、稳健且可解释的推理。 ScanQA 和 SQA3D 的实验结果表明,与之前的 无需训练 和微调的 3D-LLM 相比,ViewMind3D 实现了具有竞争力的性能。特别是,我们的方法提高了空间基础问题类型的性能,例如 SQA3D 中的“什么”问题,同时保持较高的整体准确性 (50.8\%) 并在 ScanQA 上达到 73.4 CIDEr。这些结果表明,通过通用 LLM 和 VLM 的模块化编排可以实现有效的 3D 推理,以实现现实环境中的机器人感知。