论文
用于多模态全频谱法医信号感知的深度残留注入 大语言模型
Deep Residual Injection for Full-Spectrum Forensic Signal Perception in Multimodal Large Language Models
摘要
多模态 大语言模型 (MLLM) 因其强大的语义理解而在取证中得到越来越多的采用。随着人工智能生成的图像变得真实,仅语义级别的不一致往往不足以进行可靠的检测。这就引发了一个关键问题:MLLM 是否可以实现全谱取证信号感知,即在不牺牲预先训练的语义知识的情况下捕获底层生成伪迹。我们进一步对 MLLM 中的取证信号感知进行分层分析,表明语义信息主要在早期到中间层中形成,而用于工件学习的直接 微调 会破坏这些语义表示。基于这一见解,我们提出了深度视觉残差 MLLM(Deep-VRM)来保留早期语义处理,同时将特定于工件的视觉信号作为残差路径注入到中间层,在中间层中它们与语义标记表示融合并通过后续可训练层传播。这使得后面的层能够联合建模语义推理和信号级取证线索,令人惊讶的是,该模型学会根据输入自适应地利用不同级别的取证信号,从而实现稳健且可泛化的检测性能。大量的实验表明,我们的方法在大多数基准测试中都达到了最先进的水平。代码和数据可在 https://github.com/KQL11/Deep-VRM 获取。