论文
WildDet3D:在野外扩展即时 3D 检测
WildDet3D: Scaling Promptable 3D Detection in the Wild
摘要
从单个图像中理解 3D 对象是空间智能的基石。实现这一目标的关键一步是单目 3D 对象检测,即从输入 RGB 图像中恢复对象的范围、位置和方向。为了在开放世界中实用,这样的检测器必须超越封闭集类别,支持不同的提示模式,并在可用时利用几何线索。进展受到两个瓶颈的阻碍:现有方法是为单一提示类型设计的,缺乏整合额外几何提示的机制,并且当前的 3D 数据集仅涵盖受控环境中的狭窄类别,限制了开放世界的传输。在这项工作中,我们解决了这两个差距。首先,我们介绍 WildDet3D,这是一种统一的几何感知架构,它本身接受文本、点和框提示,并且可以在推理时合并辅助深度信号。其次,我们展示了 WildDet3D-Data,这是迄今为止最大的开放 3D 检测数据集,通过从现有 2D 注释生成候选 3D 框并仅保留经过人类验证的框来构建,在不同的现实世界场景中生成跨 13.5K 类别的超过 100 万张图像。 WildDet3D 在多个基准和设置上建立了新的最先进技术。在开放世界设置中,它在我们新推出的带有文本和框提示的 WildDet3D-Bench 上达到了 22.6/24.8 AP3D。在 Omni3D 上,带有文本和框提示的 AP3D 分别达到 34.2/36.4。在零样本评估中,它在 Argoverse 2 和 ScanNet 上达到了 40.3/48.9 ODS。值得注意的是,在推理时结合深度线索会带来巨大的额外收益(跨设置平均 +20.7 AP)。