论文

SEED:简单的 ViT 和不断发展的工具,用于可解释的文本伪造检测

SEED: Simple ViT and Evolving Harness for Explainable Text Forgery Detection

应用与实践视觉感知与空间理解

摘要

人工智能辅助图像编辑威胁到对财务、法律和身份记录的信任。 ACM MM 2026 的 GenText-Forensics Challenge 通过要求结构化取证报告来解决这个问题,其中集成了以多语言文本为中心的伪造图像的检测、像素级定位和自然语言解释。我们推出 SEED,这是一个由三个组件组成的模块化系统。首先,相似性引导的管道增强了各种合成伪造品的训练。其次,基于 DINOv3 并采用 LoRA 适配构建的单个 ViT 联合执行检测和像素级定位,同时保留具有最小可训练参数的预训练先验。第三,不断发展的工具采用检测器的预测并通过 MLLM 生成完整的取证报告,并通过优化报告质量的提议者-评估者循环进行迭代改进。 SEED 在 GenText-Forensics Challenge 中排名第三。代码和数据可在 https://github.com/KahimWong/GenText-Forensics-3rd-Place 获取。