论文
深伪检测与解释:视觉基础模型和视觉语言模型协同
MSU Team at the Explainable Deepfake Detection Challenge 2026: Grounded Artifact Evidence for Deepfake Detection
摘要
生成图像模型的最新进展使许多经过处理的图像变得高度逼真,从而提高了对探测器的需求,探测器不仅准确,而且能够为其决策提供视觉证据。在本文中,我们提出了针对 XPlainVerse 数据集 [1] 上的可解释 Deepfake 检测挑战 [2] 的解决方案,其中系统需要预测图像是真还是假,并根据可见的取证线索生成复杂和简单的解释。我们的方法遵循模块化检测和解释设计。对于真/假决策,我们构建了一个多主干检测器,将多个 DINOv3 模型与 Mesorch 篡改定位特征相结合,将预训练的视觉表示、DCT 感知线索和多尺度取证信息结合在一起。为了将解释证据注入检测器,我们使用基于 Grounding-DINO 的伪掩模生成管道,将训练解释中的局部伪影描述转换为伪影证据图的弱图像块级监督。我们进一步引入局部图像块级 对比目标,可在探测器特征空间中分离伪影和真实性证据,而不需要配对图像或像素级篡改掩码。对于语言输出,我们使用类条件 Qwen3-VL 模型来生成虚假和真实预测的复杂解释,然后是 GRPO 优化的文本简化模型。所提出的方法在 XPlainVerse 的挑战子集上进行了训练和评估。在完整的测试中,我们提交的检测准确率达到了 0.9349,解释得分为 0.5571,最终挑战得分为 0.7456。
