论文
MIC:核对AI生成图像与配文的一致性并解释矛盾
MIC: Explaining Image-Claim Inconsistencies in AI-Generated Multimodal Misinformation
摘要
与人工智能生成的图像相结合的主张是一种快速增长的错误信息形式。现有的自动事实检查(AFC)方法主要将此视为来源问题,检测低级合成伪影来确定图像是否是人工智能生成的。然而,此类方法并不能验证人类事实检查人员经常检查的内容:图像的内容是否与其所附声明所暗示的上下文一致。为了解决这一差距,我们引入了 MIC(多模态不一致检查),这是一个 AFC 框架,它通过检测人工智能生成的多模态错误信息并使用世界知识解释不一致性来协助人类事实检查人员。 MIC首先使用监督微调(SFT)进行任务适应,然后应用组相对策略优化(GRPO)直接优化组件级可验证奖励,用于判决预测、不一致类型分类、视觉证据描述和世界知识解释。我们进一步介绍了 MIC-Bench,这是一个基准,包含源自 4,406 个声明的 8,812 个图像声明实例,其中每个声明都与真实图像和人工智能生成的对应物配对,引入了受控的上下文不一致。与单独的 SFT 相比,GRPO 在分布内和分布外设置中分别将 Macro-F1 进一步提高了 4.67 和 4.11 分,同时还提高了视觉证据描述和世界知识解释与参考注释的语义相似性。我们的代码和数据可在 https://github.com/UKPLab/arxiv2026-mic. 获取