论文

释放视觉语言语义以进行 Deepfake 视频检测

Unleashing Vision-Language Semantics for Deepfake Video Detection

应用与实践行业应用

摘要

最近的 Deepfake 视频检测 (DFD) 研究表明,预训练的视觉语言模型 (VLM)(例如 CLIP)在检测不同身份的伪影方面表现出强大的泛化能力。然而,现有的方法仅专注于利用视觉特征,忽视了它们最独特的优势——嵌入潜在空间的丰富的视觉语言语义。我们提出了 VLAForge,一种新颖的 DFD 框架,它释放了这种跨模态语义的潜力,以增强模型在深度伪造检测中的辨别能力。这项工作 i) 通过 ForgePerceiver 增强 VLM 的视觉感知,ForgePerceiver 充当独立学习器,从粒度和整体角度捕捉各种微妙的伪造线索,同时保留预先训练的视觉语言对齐 (VLA) 知识,ii) 提供补充的判别线索——身份感知 VLA 分数,通过将跨模态语义与 ForgePerceiver 学习的伪造线索相结合而得出。值得注意的是,VLA 分数通过身份先验文本得到增强,提示捕获针对每个身份定制的真实性线索,从而实现更具辨别力的跨模式语义。对视频 DFD 基准的综合实验,包括经典的换脸伪造和最近的全脸生成伪造,表明我们的 VLAForge 在帧和视频级别上都远远优于最先进的方法。代码可在 https://github.com/mala-lab/VLAForge 获取。