论文

Flame3D:使用代理语言模型进行 3D 场景的零样本组合推理

Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models

智能体系统Agent 工具调用

摘要

3D 场景理解涵盖对自由空间、对象定位、假设对象插入、复杂几何关系的推理,以及将所有这些与外部工具和数据源集成。现有的 3D 理解方法通常依赖于大规模 3D 语言训练或关注对象基础和简单的空间关系。我们认为,激发 3D 语言训练的广泛概括可以在推理时实现,无需 3D 特定训练。我们提出了 Flame3D,这是一个 无需训练 框架,它将场景表示为可编辑的视觉文本 3D 记忆,并通过可组合的空间工具将它们暴露给现成的 MLLM。 Flame3D 还允许代理在推理时合成自定义空间程序,从而实现对布局、空白空间和场景中尚不存在的对象的开放式推理。外部数据和修正可以添加到内存中,无需重新训练。除了在 ScanQA 上展示经过微调的 3D-LMM 方法的竞争性能外,我们还通过在策划的组合空间推理基准 Compose3D 上对其进行评估来研究 Flame3D 的多跳 3D 推理能力。我们发现固定工具存在不足,代理在推理时综合空间操作的能力至关重要。这些结果引发了一个问题:3D 场景理解的未来进展是否应该侧重于更丰富的场景记忆和富有表现力的构图抽象?