论文

HAJJv2-CrowdCount:密集人群计数的零样本基准

HAJJv2-CrowdCount: Zero-Shot Benchmark for Dense Crowd Counting

模型评测基准与评测资源

摘要

朝觐视频中的自动人群计数很困难,不是因为当前的模型缺乏容量,而是因为视频片段违反了这些模型所建立的假设:摄像机从陡峭的、接近垂直的角度观察人群,个体之间广泛遮挡,单个帧可以容纳一千多人。在这种环境中测试人群计数的基准要么是私有的,要么不是每秒详细的。我们重新访问 HAJJv2 数据集并贡献 HAJJv2-CrowdCount:其测试视频的每秒人工注释人群计数。使用这些注释,我们对最近的三种零样本计数范例进行了基准测试:开放词汇检测器(YOLO-World)、基于点的计数器(APGCC)和基于提示的分段计数器(SAM3Count)。 SAM3Count 获得最低的总体平均绝对误差(MAE 70.4,95% CI 56.0-86.1),领先于 YOLO-World (92.0) 和 APGCC (152.9)。然而,在与部署最相关的机制中,这种顺序是相反的:在最密集的帧上,基于检测和基于分段的计数器都急剧退化(MAE超过300),而基于点的计数器退化得更加优雅(MAE 114.9)。这种倒转与朝觐人群管理的决策相关,在最密集和最闭塞的场景中最需要可靠的计数。注释的发布是为了支持这些结果的复制和扩展。