论文

ForensicsTok:用于图像篡改定位的取证引导标记化建模

ForensicsTok: Forensics-Guided Tokenized Modeling for Image Tampering Localization

应用与实践视觉感知与空间理解

摘要

多模态 大语言模型 (MLLM) 为取证任务提供强大的推理能力,但利用外源分段解码器的现有方法通常会遇到定位不佳的问题。对缝合管道的依赖在反向传播过程中引入了信息瓶颈,这会稀释空间信号并受到分段器语义先验的限制。为了解决这些限制,我们提出了 ForensicsTok,它将图像操作定位重新表述为自回归序列生成任务。 ForensicsTok 直接生成空间定位标记序列,无需中介监督即可实现精确的掩模预测。具体来说,我们引入了词元 Splatting 解码器 (TSD),通过代码簿感知的代码平滑将词元映射到二进制掩码,从而减轻确定性去词元器的尖锐梯度。此外,为了捕获不同的篡改线索,我们提出了一个分层专家融合(HEF)模块,该模块从取证专家模型中注入多尺度特征。这种统一的架构有效地弥补了标准 MLLM 中取证先验的缺乏。对六个基准的广泛实验表明,ForensicsTok 比现有的基于 MLLM 的基线有了显着的改进,并且比强大的法医专家基线略有改进,同时对扰动表现出更强的鲁棒性。