论文
LaP-Forensics:用于 Deepfake 检测的潜在像素一致性引导多模态推理
LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection
摘要
最近的生成模型可以生成几乎没有明显视觉伪影的图像,削弱探测器和仅依赖于表面外观的解释。我们提出了 LaP-Forensics,这是一个多模态框架,通过基于重建的取证证据增强 RGB 语义。冻结的稳定扩散 DDIM 反转重建模型提供固定的重建参考,其残差图测量与该参考的局部兼容性。在结构化Where-What-Why模型预测文本分析和伪影掩模之前,独立投影仪对RGB图像和残差图进行编码。受监督的微调之后是组相对策略优化(GRPO),其奖励将掩模重叠与输出结构和证据参考项相结合。这些文本侧术语鼓励模型引用一致性图,但不构成自由形式文本事实的验证者。单独的图像级头部融合了 RGB 和 DDIM 残差类特征。实验展示了 UniversalFakeDetect 上的跨生成器检测以及官方 SynthScars 基准测试上的竞争工件定位。受控线索构建、反转视野、组件、奖励项和反事实分析支持评估设置下残差流的实用性,而自由格式文本 忠实性 和后处理下的可靠性仍然存在开放限制。