论文

RefineAny3D:深度细化作为单目 3D 检测的语义对齐

RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection

模型训练监督微调与指令调优

摘要

单目 3D 对象检测跨越两种机制:在固定类别词汇中运行的闭集检测器,以及通过利用 3D 几何的深度基础模型来定位任意类别的开放词汇检测器。我们发现,当前的深度基础模型尽管具有强大的零样本泛化能力,但缺乏对象级精度 3D 检测需求:用最先进的深度基础模型替代强大的检测器的预测深度会降低准确性,甚至低于检测器自己的预测。我们没有将探测器或深度模型推向更准确的端到端,而是将对象级深度细化视为一项独立的任务,并提出了RefineAny3D,这是一种视觉语言模型,可以在不预测数值的情况下校正深度。我们的主要见解是,深度误差在图像空间中具有直接的视觉特征:当投影到图像上时,正确放置的框紧紧包围对象,而太远的框投影太小,太近的框投影太大。因此,深度细化简化为视觉对齐问题而不是度量回归问题,我们通过使用动作标记扩展 VLM 的词汇表来实例化该问题,用分类决策替换数字深度输出,并通过在大规模思想链数据集上监督模型,该数据集将每个决策建立在明确的视觉证据中。作为单个事后步骤应用,RefineAny3D 在封闭集检测器、开放词汇检测器和 3D 自动标记工具中提供一致的增益,并且无需重新训练即可推广到新的类别、场景和摄像机。