论文

CoordRefer:多视图图像的坐标感知 3D 视觉基础

CoordRefer: Coordinate-Aware 3D Visual Grounding from Multiview Images

应用与实践视觉感知与空间理解

摘要

基于多视图图像的 3D 视觉基础预测坐标系以定义坐标系,然后回归 3D 边界框以进行定位。然而,现有方法联合优化坐标系选择和框回归,导致相对坐标框模糊性和视觉定位性能下降。出现这种模糊性的原因是同一个框允许跨坐标系的不同数值表示,从而创建多个优化目标并产生无效的折衷预测。为了应对这一挑战,我们提出了 CoordRefer,这是一个坐标感知框架,它将坐标系选择与坐标条件视觉定位分离。 CoordRefer 首先选择一个参考系来定义坐标系,然后在坐标系上调节 3D 框预测。我们执行坐标感知监督 微调 来建立坐标系选择和坐标条件盒回归,然后使用基于 3D IoU 的奖励进行组相对策略优化,以使两个阶段与下游视觉定位质量保持一致。在使用 Qwen3-VL-2B 的 ScanRefer 上,CoordRefer 在与坐标无关的基线上在 Acc@0.25 中实现了 11% 的增益,在 Acc@0.5 中实现了 7% 的增益,而其几何精炼变体超越了使用显式 3D 输入的方法。