论文

从敏锐的眼睛到专家的思维:内化 MLLM 中的专家知识以进行篡改文本检测

From Sharp Eyes to Expert Mind: Internalizing Expert Knowledge in MLLMs for Tampered Text Detection

摘要

篡改文本检测 (TTD) 对于保护安全关键工作流程中的文档真实性至关重要。现有的专家模型可以有效地捕获微妙的操作痕迹,但通常在不同的文档域中泛化能力较差,而多模态大语言模型(MLLM)提供了更强的语义理解和可转移性,但对细粒度的取证工件仍然不敏感。这种互补性促使我们研究如何将专家取证感知内化到 MLLM 中,而不仅仅是通过外部模块访问。我们发现了阻碍这一目标的基本双重不匹配:粗略视觉标记和微小篡改区域之间的空间精度不匹配,以及面向语义的预训练和低级取证感知之间的感知粒度不匹配。为了应对这些挑战,我们提出了专家知识内化 (EKI),这是一个渐进的两阶段框架,可将法证专业知识转移到 MLLM 本身。在第一阶段,以文本为中心和以图像为中心的策略在小文本区域上建立了精确的空间焦点。在第二阶段,提出的法医通用表示对齐(FGRA)损失将浅层 LLM 表示与预先训练的法医专家的表示对齐,使模型能够在此类线索被更深层次的语义抽象稀释之前获得细粒度的伪影感知。对多个域内和跨域基准的大量实验表明,与现有的基于专家模型和基于 MLLM 的方法相比,EKI 实现了最先进的性能和更强的泛化性。此外,仅在训练期间需要专家,从而使生成的 MLLM 能够保持与普通模型几乎相同的推理效率,而无需依赖任何外部专家进行推理。