论文

ManiVid:面向视频篡改检测、定位与解释的数据集和方法

ManiVid: Unified and Explainable Forensic Analysis of Manipulated Videos

模型评测基准与评测资源

摘要

人工智能生成视频 (AIGV) 的快速发展增加了欺骗性视频操纵带来的风险。与完全合成的视频不同,经过处理的视频保留了大部分源内容并仅改变局部区域,这使得取证分析特别具有挑战性。现有的视频伪造研究在数据和方法上都面临两个局限性:(1)针对被篡改视频量身定制的高质量数据集和基准仍然稀缺。 (2) 多模态大语言模型 (MLLM) 将伪造分析扩展到二分类之外,但难以使用低级取证线索并提供精确的像素级基础。具体来说,我们介绍了 ManiVid,这是一项统一的取证分析任务,涵盖伪造检测、伪影定位和操纵视频的异常解释。我们构建了 ManiVid-38K,这是第一个将一般视频的配对、开放词汇本地化操作与真实性标签、伪造掩模和异常解释相结合的数据集。它包含约 19K 个手动验证的真假视频对,大部分为 1080P 分辨率,在 2 个范式下生成,具有 15 个强大的生成模型。我们为 ManiVidBench 采样了 1K 对,在六种操作类型和生成模型之间进行平衡,以进行公平评估。我们进一步提出 ManiVidLens,一个用于可解释视频伪造分析的统一框架。其取证证据路由器为多模式推理和视频分割提供共享的低级取证证据。其提示蒸馏模块将定位状态转换为语义和几何提示,并提取空间先验以进行掩模解码和全视频传播。 ManiVidLens 在篡改痕迹定位(+21.1% mIoU;+21.3% J&F)和异常解释(+131.3% ROUGE-L;+9.9% CSS)方面实现了相对最强的比较方法的相对增益。其伪造检测仍然与专用分类器相当(0.914 Acc;0.913 F1)。

ManiVidLens统一伪造检测、伪影定位和异常解释,并以取证证据路由器提供条件。
图3(图注摘要):ManiVidLens统一伪造检测、伪影定位和异常解释,并以取证证据路由器提供条件。