论文

统一语义先验和高频跟踪:通过专家混合增强 V-JEPA,实现稳健的合成图像取证

Unifying Semantic Priors and High-Frequency Traces: Enhancing V-JEPA with Mixture-of-Experts for Robust Synthetic Image Forensics

摘要

社交媒体平台上未经控制的图像扩散增加了错误信息的传播,对公众信任和信息完整性构成严重威胁。现代深度换脸检测器通常依靠视觉变换器(ViT)来捕获表征完全合成或局部篡改图像的低级不一致。然而,对此类基础模型的全球理解不足以单独区分真实和虚假的多媒体内容,特别是在图像通过社交媒体压缩或传输的挑战性场景中。在本文中,我们利用此类世界模型所展示的视觉现实的广义表示,率先将联合嵌入预测架构(JEPA)模型应用于深度伪造检测。我们假设并实证证明,JEPA 模型的内在世界理解可以用作深度伪造检测器的强大先验。为了充分利用 JEPA 功能,我们提出了 MoE-JEPA,这是一种用于深度伪造检测的双流架构。通过使用剩余专家混合 (MoE) 机制以及噪声流分支增强 V-JEPA 2 主干,我们的模型动态地内化了取证知识。此外,采用门控注意力多实例学习(MIL)模块来确保精确的空间语义理解。 MoE-JEPA 根据 SID-Set 基准(包括 30 万张人工智能生成的、经过篡改的真实图像)进行评估,建立了新的最先进的模型,准确率达到 95.54%,成功超越了更大的模型。