论文
交互表示实际上衡量什么?弱监督暴力检测中的事件前可分离性
What Do Interaction Representations Actually Measure? Pre-Event Separability in Weakly-Supervised Violence Detection
摘要
铰接式人体姿势提供了超出粗略空间关系的详细身体配置信息,但当下游管道保持固定时,这些细节是否会产生更大的辨别信息仍不清楚。我们通过早期暴力检测来研究这一点。保持跟踪器、颞头、监督、折叠和评估固定,我们在具有集群引导间隔的视频级评估下,比较了跨越粗边界框几何的五种交互表示、匹配的手工制作的姿势模拟、丰富的姿势描述符以及从原始关节学习的匹配容量编码器。没有任何基于姿势的表示能够胜过粗略几何,尽管该子集有 15 个异常视频,但不能排除小的影响。将管道扩展到冻结的视觉编码器,并在 XD-Violence 上重复比较(137 个异常视频,是我们的 UCF-Crime 样本的九倍),人物裁剪外观和整个帧上下文都大大超出了几何形状,但上下文与 UCF-Crime 上的外观匹配,并在更大的分割上超过了它:裁剪到交互的人与编码整个帧相比没有任何优势。这促使对基准测试的测量内容进行直接测试。仅使用带注释的开始之前的帧对异常视频进行评分,在删除序列长度作为提示的控制下,在两个基准上保留 39-91% 的高概率分离,包括七个手工设计的几何通道。对最严格的预发生窗口的检查可识别出具体的出处文物:提供正常类别的监控录像中缺少社论标题卡和平台水印。因此,这里的视频级 AUC 是事件证据和事件前源线索的复合体,是可以掩盖表示之间差异的共享歧视源。诊断只需要注释这些已经发布的基准。