论文
相同语义,不同结果:论知识冲突下多模态 LLM 的模态鲁棒性
Same Semantics, Different Outcome: On the Modality Robustness of Multimodal LLMs under Knowledge Conflict
摘要
多模态 大语言模型 (MLLM) 越来越多地以异构形式提供上下文证据:作为文本段落、作为同一段落的渲染图像,或两者一起。然而,目前尚不清楚这些表面形式的处理有多一致,特别是当证据与模型的参数知识相冲突时。我们研究了 13 个 MLLM 和两个数据集的知识冲突下的模态稳健性,发现它们远非稳健。 (1) 与普遍看法相反,模型更倾向于图像形式而不是文本形式更容易与参数化知识相矛盾的上下文; (2)当矛盾的文本和图像一起呈现时,首选模态本质上是任意的,随输入顺序、模型和数据集的不同而变化。我们进一步证明这种不稳定性具有实际后果:它降低了多模式 RAG 的性能,并且可以被对抗性攻击利用。为了减轻这种脆弱性,我们研究了几种简单的技术——提示、引导、监督 微调 (SFT) 和直接偏好优化;大多数被证明是无效的,而 SFT 取得了一定的成功。因此,我们呼吁提高对这种不一致的认识,并认为这是根本性的,需要在多个训练阶段予以关注。