论文
MV2GF:使用视觉几何基础模型的多视图行人检测
MV2GF: Multi-view Pedestrian Detection with a Visual Geometric Foundation Model
摘要
多视图行人检测(MVPD)旨在从多视图图像中以鸟瞰图的形式检测行人。最近的 MVPD 方法采用了一个统一的框架,将 2D 图像特征投影到 3D 世界空间中,并将它们聚合成单个特征。尽管它们很有效,但由于两个主要问题,它们很难推广到训练期间看不见的相机配置。首先,它们很难在不可见的相机配置中跨视图捕获准确的视觉几何形状。其次,他们使检测模型高度依赖于训练期间由图像特征投影产生的失真模式。为了解决这些问题,我们利用视觉几何基础模型并提出 MV2GF。该基础模型在跨视图捕获视觉几何和预测不同相机配置中的准确 3D 属性方面表现出很强的泛化能力。 MV2GF 将特定于任务的特征与基础模型提取的通用几何特征融合在一起,即使在不可见的相机配置中也能有效捕获视觉几何。此外,MV2GF 使用基础模型预测的 3D 点图将图像特征中的每个像素投影到适当的 3D 位置,从而防止检测模型在训练期间依赖于失真模式。我们的实验证明了利用 MVPD 视觉几何基础模型的有效性,并且 MV2GF 比现有方法具有更好的泛化能力。