论文
DocShield:通过循证代理推理迈向人工智能文档安全
DocShield: Towards AI Document Safety via Evidence-Grounded Agentic Reasoning
摘要
生成式人工智能的快速发展使得以文本为中心的图像伪造变得越来越真实,给文档安全带来了重大挑战。现有的取证方法主要依赖视觉线索,缺乏基于证据的推理来揭示微妙的文本操纵。检测、定位和解释通常被视为孤立的任务,限制了可靠性和可解释性。为了应对这些挑战,我们提出了 DocShield,这是第一个将以文本为中心的伪造分析制定为视觉逻辑协同推理问题的统一框架。其核心是一种新颖的交叉线索感知思维链 (CCT) 机制,可实现隐式代理推理,迭代地交叉验证视觉异常与文本语义,以产生一致的、基于证据的取证分析。我们进一步引入了基于 GRPO 的优化的加权多任务奖励,调整推理结构、空间证据和真实性预测。为了补充该框架,我们构建了 RealText-V1,这是一个类似文档的文本图像的多语言数据集,具有像素级操作掩码和专家级文本解释。大量实验表明,DocShield 的性能显着优于现有方法,在 T-IC13 上比专用框架的宏观平均 F1 提高了 41.4%,比 GPT-4o 提高了 23.4%,并且在具有挑战性的 T-SROIE 基准测试中获得了一致的收益。我们的数据集、模型和代码将公开发布。