论文
以文本为中心的图像取证的证据引导检测、定位和解释
Evidence-Guided Detection, Localization and Explanation for Text-Centric Image Forensics
摘要
AIGC 的快速进步使得以文本为中心的图像处理变得越来越容易,带来了新的取证挑战,不仅需要真实性检测,还需要空间基础和基于证据的解释。本文介绍了我们针对 ACM Multimedia 2026 上的 GenText-Forensics Challenge 的解决方案。我们提出了一种证据引导的检测器-定位器-推理器系统,其中图像级检测器提供全局真实性先验,专用定位器提取被篡改的区域作为空间基础证据,基于 MLLM 的推理器生成基于专家取证证据的结构化取证报告。这些模块通过级联证据流连接:检测器控制后续定位和提示过程,定位器将篡改响应转换为定位框,推理器经过训练将检测器决策和本地化证据合成到最终报告中。作为我们方法的关键部分,我们引入迭代难度感知挖掘来提高定位质量,并应用报告掩模一致性后处理来使报告证据对齐与预测掩模保持一致。在官方隐藏测试集上,我们的系统最终得分为 0.638,在挑战中排名第二,验证了所提出的证据引导系统的有效性。该代码可在 https://github.com/peifengLiu42/ACMMM26-evidence-guided- detector-localizer-reasoner-system 获取。