论文
VRAG-DFD:基于 MLLM 的 Deepfake 检测的可验证检索增强
VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection
摘要
在 Deepfake 检测(DFD)任务中,研究人员提出了两种基于 MLLM 的方法:与小型 DFD 检测器的互补组合,或静态伪造知识注入。专业伪造知识的缺乏阻碍了这些 DFD-MLLM 的性能。为了解决这个问题,我们深入思考了两个富有洞察力的问题:如何为MLLM提供高质量的相关伪造知识?以及如何在给定嘈杂的参考信息的情况下赋予 MLLM 批判性推理能力?值得注意的是,我们试图通过结合检索增强生成(RAG)和强化学习(RL)来解决上述两个问题并给出初步答案。通过RAG和RL技术,我们提出了具有准确的动态伪造知识检索和强大的批判推理能力的VRAG-DFD框架。具体来说,在数据方面,我们用RAG构建了两个数据集:用于DFD知识注释的法医知识数据库(FKD)和用于关键CoT构建的法医思维链数据集(F-CoT)。对于模型训练,我们采用三阶段训练方法(Alignment->SFT->GRPO)来逐步培养MLLM的批判推理能力。在性能方面,VRAG-DFD 在 DFD 泛化测试中实现了 SOTA 和具有竞争力的性能。