论文

迈向相机稳健的 3D 定位:MLLM 的方程锚定工具使用

Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs

智能体系统Agent 工具调用

摘要

多模态 大语言模型 (MLLM) 中的 3D 定位(包括 3D 对象检测和 3D 视觉基础)从根本上受到相机固有模糊性的限制:同一图像在不同相机下允许不同的 3D 场景。现有的 MLLM 要么忽略相机参数并过度拟合规范的训练内在函数,要么从外部工具检索深度和 3D 线索,但将返回的值视为参考线索(模型可以自由隐式解释的数字提示),两者都会阻止相机信息确定性地传播到预测中。我们提出了一个方程锚定的工具使用框架,将空间工具重新用作公式变量。所提出的框架主动检索相机内在参数并采样多点度量深度,在思想链 (CoT) 中显式写入针孔反投影方程 $\hat{X} = (u_c - c_x)\bar{Z}/f_x$,并在回归最终 9-DoF 边界框之前将工具输出代入公式中。在将相机内在参数从 $0.5\times$ 重新调整到 $1.5\times$ 下的 3D 物体检测和 3D 视觉基础任务中,我们的方法优于仅 RGB 和工具增强的基线,在相机偏离训练比例最大的情况下取得了显着的收益。代码和数据将被发布。