论文

MoDA:检测与归因动作感知深伪视频

Stop My Dancing! Understanding, Detecting and Attributing Motion-Aware Deepfake Videos

模型评测基准与评测资源安全与风险评测

摘要

姿态引导扩散模型已经能够合成运动中的完整人体,形成动作感知深伪(MAD)这一新类型,其视频已触达数亿观众。为理解这一威胁,我们构建首个MAD专用基准与测量框架,包含超过150万帧,混合1,363段真实视频及六种可控生成器产生的30,122段合成视频,并加入现实扰动和开放世界评测划分。分析发现,虽然视频整体连贯,仍暴露微弱但可靠的线索:模型依赖有限输入帧合成运动,必须预测运动边界处的连贯变化,因而产生高频伪影和生成模型特有的频谱指纹。基于这些观察,我们提出首个面向MAD视频检测与归因的防御框架MoDA。它通过跨域对齐和多尺度聚合,将空间语义与包含隐写分析信息的频率特征结合。在分布内和跨数据集检测上,准确率分别为94.8%和89.1%,较先前工作提高10%—25%;生成模型归因准确率为91.5%。在两个未见过的商业MAD平台生成的200段视频上,准确率为81.94%,显示了零样本迁移潜力;在开放互联网收集的1,200段未见MAD视频、共5.5万帧上,检测准确率为78.13%。在白盒、灰盒和黑盒自适应攻击下,MoDA检测与归因表现相对稳定,而基线准确率迅速下降。