论文
对抗性 Deepfake 生成和基于纯化的对抗性检测的研究
Adversarial Deepfake Generation and an Investigation of Purification-Based Adversarial Detection
摘要
本文介绍了“Go To 德国”团队参与 ImageCLEF 2026 Deepfake 检测与生成任务的情况。对于图像生成任务,我们采用 FLUX.1-dev 和 PuLID 进行身份保护人脸合成,并结合同时针对 12 个检测器的多模型 PGD 对抗攻击(DiffJPEG-in-loop、MI/DI/EoT、自适应加权、两阶段热启动)。我们的方法对组织者检测器的规避率为 90%,对参与者检测器的规避率为 57.6%,最终生成分数为 0.4170。对于图像检测任务,我们将两个互补的检测器(用于 AI 生成图像的 SigLIP+DINOv2 和用于面部操作的 GenD-DINOv3)组合在最大概率集成中,在基线 Deepfakes 上实现 99.4% 的准确率,但在真实图像上误报率很高,最终检测得分为 0.6986。除了官方提交的内容之外,我们还对基于纯化的对抗性检测进行了自行调查,比较了共享 CLIP ViT-L/14 主干的六个检测器的三个检测信号系列。我们发现,原始 $|Δ\text{logits}|$ 在中值 3 的净化下,通过 EFFORT 检测器应用,在四种对抗性源类型中将对抗性输入与 AUROC 0.81-0.98 的干净输入分开——这一发现驳斥了简单的骨干保留假设,并在 Q70 处暴露了信号崩溃的尖锐 JPEG 质量悬崖。