论文
FakeVLM-R1:通过 CoT 内化物理定律以进行合成图像检测
FakeVLM-R1: Internalizing Physical Laws via CoT for Synthetic Image Detection
摘要
生成人工智能技术的发展将合成图像的视觉真实感提升到了前所未有的水平。尽管当前基于大型多模态模型(LMM)的可解释检测方法已经取得了一定的进展,但它们仍然依赖于从大量伪造数据中导出的模仿学习。因此,他们缺乏真正的因果推理能力,并且容易产生解释性幻觉。为了克服这一瓶颈,我们提出了 FakeVLM-R1,旨在赋予模型在执行综合检测任务时具有类似人类的批判性思维能力。该框架以监督 微调 (SFT) 为基础,将组相对策略优化 (GRPO) 与批判性思维链 (CoT) 机制集成在一起。在推理阶段,模型执行“双向辩证推理”过程:在提出伪造假设的同时,必须同时调用物理常识来构建真实性反证明。此外,我们利用高质量样本构建了FakeClue++数据集,该数据集广泛引入了以真实图像的物理定律为指导的注释,为模型提供了统一的真实性锚。实验证实,FakeVLM-R1 在多个基准测试中的评估模型中实现了 SOTA 性能。它不仅实现了高精度、逻辑上可解释的检测,而且解决了现有方法对真实图像的过度拒绝偏差,展示了针对扰动的泛化性和鲁棒性。