论文
用于泛化 Deepfake 视频检测的多智能体取证推理
Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection
摘要
恶意使用生成人工智能来创建高度逼真的深度伪造视频引发了严重的道德问题,并对人工智能安全构成了重大挑战。然而,现有的 Deepfake 视频基准测试对最新合成方法的覆盖范围有限,并且通常缺乏可靠的细粒度文本注释。与此同时,传统的探测器和多模态 大语言模型 (MLLM),无论是作为单一模型运行还是依赖于单一分析视角,通常都无法捕获微妙的伪造伪影,从而限制了它们对新兴人工智能生成方法的推广。为了解决这些限制,我们引入了 FaceVid-Forensics-100K,这是一个大规模的 Deepfake 视频数据集,包含 100,000 个视频,涵盖 33 种合成方法,涵盖面部交换、面部重演和全脸合成,包括最新的生成器,例如 Seedance 2.0。该数据集提供了视觉观察的细粒度文本注释和与判决一致的取证解释,通过由高级 MLLM 提供支持的多模型聚合和冲突解决管道自动合成。在此基准的基础上,我们提出了一个多代理取证推理框架,该框架采用四个专门的领域专家代理从四个角度独立分析伪造线索:纹理、照明、运动和物理。然后,评判智能体会核对他们的报告,以得出最终的预测和解释。对域外测试集的广泛评估表明,尽管我们的框架完全由小型开源 MLLM 组成,但其性能优于包括闭源 GPT 和 Gemini 模型在内的所有方法,并且在该基准测试的所有报告指标中排名第一。该项目页面位于 https://xavierjiezou.github.io/ARGUS/。