论文
迈向内在感知单目 3D 物体检测
Towards Intrinsic-Aware Monocular 3D Object Detection
摘要
单目 3D 对象检测 (Mono3D) 旨在从单个 RGB 图像推断 3D 空间中的对象位置和尺寸。尽管最近取得了进展,但现有方法仍然对相机内在参数高度敏感,并且很难在不同的设置中进行泛化,因为内在参数控制着 3D 场景如何投影到图像平面上。我们提出了 MonoIA,一个统一的内在感知框架,通过基于语言的表示来建模和适应内在变化。关键的见解是,内在变化不是数字差异,而是改变明显比例、视角和空间几何的感知转变。为了捕捉这种效果,MonoIA 采用 大语言模型 和视觉语言模型来生成内在嵌入,对相机参数的视觉和几何含义进行编码。这些嵌入通过内在适应模块分层集成到检测网络中,允许模型根据特定于相机的配置来调制其特征表示,并保持跨内在的一致的 3D 检测。这将内在建模从数字调节转变为语义表示,从而实现跨摄像机的稳健且统一的感知。大量实验表明,MonoIA 在 KITTI、Waymo 和 nuScenes 等标准基准上取得了最先进的结果(例如,在 KITTI 排行榜上 +1.18%),并进一步提高了多数据集训练下的性能(例如,在 KITTI Val 上 +4.46%)。