论文

保护伪造品:本地规模的人工智能生成视频检测

Preserving Forgery Artifacts: AI-Generated Video Detection at Native Scale

模型评测基准与评测资源

摘要

视频生成模型的快速发展使得高度逼真的合成媒体的创建成为可能,引起了社会对错误信息传播的严重担忧。然而,当前的检测方法存在严重的局限性。它们依赖于固定分辨率调整大小和裁剪等预处理操作。这些操作不仅会丢弃微妙的高频伪造痕迹,还会导致空间失真和重大信息丢失。此外,现有方法通常是在过时的数据集上进行训练和评估的,这些数据集无法捕捉现代生成模型的复杂性。为了应对这些挑战,我们引入了一个全面的数据集和一个新颖的检测框架。首先,我们整理了来自 15 个最先进的开源和商业生成器的超过 14 万个视频的大型数据集,以及专门为评估超现实合成内容而设计的 Magic Videos 基准。此外,我们提出了一种基于 Qwen2.5-VL Vision Transformer 的新型检测框架,该框架以可变的空间分辨率和时间持续时间本地运行。这种原生规模的方法有效地保留了传统预处理过程中通常丢失的高频伪影和时空不一致。大量实验表明,我们的方法在多个基准测试中实现了卓越的性能,强调了本地规模处理的至关重要性,并为人工智能生成的视频检测建立了强大的新基线。