论文
REVEAL:多模态操作检测的参考推理
REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection
摘要
多模态操纵检测旨在同时识别伪造的图像-文本对并定位被篡改的区域,但现有的方法通常依赖于记忆孤立的伪影,并与难以察觉的操纵痕迹或域转移作斗争。受人类比较推理的启发,我们将这项任务重新表述为基于参考的验证问题,其中通过将查询与检索到的真实证据进行比较来评估真实性。我们提出了 REVEAL Reference-Enabled Verification for Evidence Analysis and Localization),这是一个专门为这种比较范式设计的框架。为了支持这一范式,我们构建了一个大型参考库,其中包含 17 万个真实的新闻图像-文本对,其中包含超过 4 万个公众人物。从技术上讲,REVEAL 采用差异感知融合机制来捕获查询和检索到的证据之间的细粒度差异。此外,我们引入了任务解耦的专家混合(MoE)架构来联合执行实例级检测和细粒度基础,有效缓解这些异构目标之间的优化冲突。大量实验表明,REVEAL 的性能显着优于最先进的方法,尤其是通过简单地更新参考库即可实现 \emph{无需训练 域适应},为检测不断变化的错误信息提供了强大且实用的解决方案。代码可在 https://anonymous.4open.science/r/REVEAL-Reference-A006 获取。