论文
Agentic 用于可解释图像伪造检测的工具增强推理
Agentic Tool-Augmented Reasoning for Explainable Image Forgery Detection
摘要
传统的图像伪造检测方法会在没有可解释证据的情况下生成二进制分数或像素级掩模,而最近基于多模态大语言模型(MLLM)的方法会生成预定分类结果的事后解释,而不是根据证据进行推理。受人类司法专家取证工作流程的启发,我们提出了 Agentic 工具增强推理 (ATAR),这是一个框架,集成了七个互补领域的 22 个专业取证工具,通过多轮推理自动检测、定位和解释图像伪造。双流取证推理范例将高级语义异常路径(放大可疑区域以进行细粒度检查)与低级伪造工件路径(调用取证工具提取客观证据)相结合。我们进一步介绍了取证课程学习:在一般经验 SFT 中,自动化的师生指导管道综合了多轮工具使用推理轨迹;在取证场景强化学习期间,工具先验课程指导早期工具探索并逐步将控制权转移给Agent,而结构化证据奖励则提供细粒度的过程级监督。 IMDL、Deepfake 检测、DMDL 和 AIGC 检测的实验表明,ATAR 在六个零样本 IMDL 基准上实现了 78.5% 的平均图像级别 F1,比最强的 MLLM 基线高出 11.8 个百分点,并且在其他任务上与专用检测器保持竞争力,同时产生更加忠实和扎实的解释。