论文

M3SunAgent:协调单目度量深度与 3D 视觉定位

M3SunAgent: Monocular 3D Spatial Understanding Agent for Metric Depth Estimation and 3D Visual Grounding

智能体系统Agent 工具调用

摘要

单目度量深度估计和3D视觉基础代表了单目3D空间理解(M3Sun)的两个互补基石,从中可以获得M3Sun所需的基本3D空间信息。然而,这些补充任务通常由单独的框架执行,这给实体智能系统带来了不灵活且不对齐的空间信息访问的挑战。在本文中,我们提出了一种用于单目3D空间理解的统一智能体(M3SunAgent),它利用大语言模型(LLM)作为空间可视化编程的任务规划器,灵活地生成结构化程序和坐标工具。对于实例级度量深度估计任务,M3SunAgent 调用对象检测器工具来定位目标,使用深度估计工具估计选定点的深度,并将这些预测聚合为实例级深度估计。我们还构建了 M3Sun 实例 (M3SI) 数据集,这是一个包含 2,910 个样本进行评估的基准。对于单目 3D 视觉基础任务,M3SunAgent 使用视觉语言模型 (VLM) 工具来定位目标并输出基本空间属性,然后结合反投影工具和维度提升工具来预测其 3D 边界框。实验结果证明了M3SunAgent的优越性能。具体来说,在实例级单目度量深度估计的评估中,M3SunAgent 在所有比较模型中实现了最佳性能,52.61% 的预测实例分布在深度误差 0.25 ($δ< 0.25$) 以下。在单目 3D 视觉基础评估中,M3SunAgent 表现出优于视觉和 VLM 模型的整体竞争性能,达到 41.73% 的 3D 平均交集比 (mIoU),比最先进的 MonoVLM 模型高出 3.62%。

M3SunAgent:协调单目度量深度与 3D 视觉定位:论文原图
图 1:M3SunAgent 概述。给定 RGB 图像和自然语言查询,LLM 选择任务并生成相应的 DSL 程序,由程序解释器使用感知模型和几何运算执行。对于实例级度量深度估计,所引用对象内的逐点深度预测被聚合成实例级度量距离。对于单目 3D 视觉基础,VLM 定位目标并预测基本空间属性,结合反投影和 2D 到 3D 提升模型来构建 3D 边界框。然后将结果用于生成最终响应。