论文

PanoPed:全景行人追踪的球面标注与仿真到真实评测

PanoPed: Beyond Bounding Boxes for Sim-to-Real Panoramic Pedestrian Tracking

模型评测模型训练应用与实践参数高效训练基准与评测资源视觉感知与空间理解

摘要

全球面全景相机让固定监控系统和移动机器人可以在各个方向跟踪人员,但平面边界框并不能完全描述人在球体上的位置。我们推出 PanoPed,这是一个用于全范围行人跟踪的模拟真实基准。 PanoPed-S 包含来自固定、四足安装和无人机安装摄像机的 108,000 帧,具有同步蒙版、深度、摄像机姿势和 3D 行人状态。 PanoPed-R 添加了来自固定摄像机的 28,002 个真实帧,其中 16,247 个带有密集注释。我们发现ERP矩形不能唯一确定可见人的球心和角度范围,而检测器的视觉查询仍然携带有关他们的信息。受到六分仪使用角度测量来定位物体的启发,我们提出了 Sextant,一种即插即用的角度定位头,只有大约 0.035M 参数。它重复使用冻结的检测器,保持跟踪对象身份不变,并且不需要额外的图像编码器。 Sextant 在我们的 PanoPed-S 测试比较中给出了最好的结果,提高了最强的基线,MOTIP, 从 47.30 到 49.49 HOTA,所有八个测试序列都有增益。无需对真实数据进行微调,相同的合成数据训练的定位头在真实视频上将 MOTIP 和 HAT 提高了 0.96-1.14 HOTA,并且两个种子都改善了每个真实序列。在没有添加定位图像编码器的比较系统中,HAT+Sextant 得分最高。

PanoPed:全景行人追踪的球面标注与仿真到真实评测:论文原图
图 1:PanoPed 和 Sextant。 (a) 固定摄像机、四足摄像机和无人机摄像机的全球观测。 (b) 概念示例:同一个盒子包含不同的可见支撑。黑色虚线标记该框;灰色十字和蓝色圆点分别标记仅框和支撑衍生的中心。 (c) Sextant 在不改变身份的情况下完善了本地化。结果显示使用种子 42;两种种子均在第 5 节中报告。模拟到真实的评估使用第 3.3 节中的支持目标。剪影是两个渲染后的 PanoPed-S 蒙版,重新缩放为一个框。