论文
MSU GenText 团队 2026 年取证挑战赛技术报告
Team MSU GenText-Forensics Challenge 2026 Technical Report
摘要
文档文本伪造已经超越了简单的像素级操作:现代攻击不仅改变文档的外观,还改变其含义,并且越来越多地针对使用此类文档的 OCR 和 LLM 管道。因此,ACM MM 2026 GenText-Forensics 挑战要求系统不仅能够确定多语言文本图像是否伪造,而且能够定位操纵点、识别攻击类型,并生成具有支持证据的人类可读的取证报告。我们提出了我们的解决方案,一个分解的思维链 (CoT) 管道,它将文档篡改检测器 (DTD) 与两个 Qwen3-VL-32B 视觉语言模型相结合,每个 LoRA 适应不同的子任务。 DTD 生成篡改概率图,并将其转换为编号的候选区域;第一个模型(过滤器)验证这些区域并分配初步的伪造类型,而第二个模型(语义侦探)合并并重新定位幸存区域,搜索像素级检测器不可见的纯语义异常,并编写最终报告。这两个模型都是通过从享有特权的 Qwen3-VL-235B 教师那里提取思维链痕迹来进行训练的,该教师可以访问真实的掩模和报告。我们的方法在 ACM MM 2026 GenText-Forensics 挑战赛中获得了第三名。我们详细描述了数据准备、测试时间增强、区域渲染、蒸馏协议和训练配置,并报告了检测器阈值、提示设计和管道分解的消融。