论文
HumanForge:具有多代理伪造原理的以人为中心的 Deepfake 视频基准
HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales
摘要
视频传播模型和时间编辑工具的快速进步使得能够生成高度逼真的以人为中心的视频,这给数字内容取证带来了前所未有的挑战。现有的基准主要关注面部交换或全局文本到视频合成,忽略了多模式对齐和复杂的人与物体或人与人交互的关键维度。为了解决这些限制,我们引入了 HumanForge,这是一个统一的、大规模的、多范式的以人为中心的视频伪造基准,包含跨越四种不同场景的 18,000 多个合成视频:音频驱动、姿势驱动、语义驱动和交互。为了在不需要劳动密集型手动标记或盲目整体提示的情况下构建和注释该数据集,我们提出了 Gen2Anno(生成到注释),一种协作的多智能体管道。 Gen2Anno 协调了六个专业代理(从驱动资产分析到基于 MoE 的参考分析和闭环验证),以动态执行视频合成并生成包含二进制真实性标签、生成模型归因和自然语言对比伪造原理的结构化注释。通过系统地将源自生成来源的预期状态与实际视觉观察进行对比,该框架生成了逻辑上有根据的取证推理链。使用最先进的传统检测器和视觉语言模型进行的广泛基准测试证明了 HumanForge 上跨生成器泛化、扰动鲁棒性和可解释推理的重大挑战。代码和数据集将公开发布。