论文
重新思考读数:解锁视频主干以进行人工智能生成的视频检测
Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection
摘要
人工智能生成的视频 (AIGV) 通常包含细微的时间伪影,这些伪影是由帧间不一致而不是单个帧内产生的。因此,捕获此类伪影的检测器应该受益于视频预训练主干,而不是仅图像主干。然而,在实践中,具有标准全局读数的视频骨干网通常无法在 AIGV 基准上胜过强大的图像预训练探针。我们将这种差距归因于读数中过度的时空聚合。视频预训练主干倾向于将每个帧压缩为单个全局描述符。这种压缩抑制了局部补丁级别的时间动态并丢弃了补丁之间的关系,而这正是 AIGV 检测最可靠依赖的线索。基于此,我们提出了 Velocity Gated Patch Velocity Profiling (V-PVP),这是一种轻量级读出装置,仅用补丁速度场上的两个并行流替换聚合层,仅添加约 50万个可训练参数。 V-PVP 用作通用即插即用模块,可在端到端 微调 和线性探测设置下持续提高不同视频主干的性能。我们的方法在 AIGVDBench 上达到 \textbf{95.28} AUC,同时保持主干网完全冻结。结果表明,只需更换聚合层即可重新激活冻结视频主干的时间潜力,恢复其在 AIGV 检测方面的优势。代码可在 https://anonymous.4open.science/r/PVP-81B3/ 获取。