论文

诊断多模态长链推理中的知识冲突

Diagnosing Knowledge Conflict in Multimodal Long-Chain Reasoning

模型评测模型行为与机制分析

摘要

多模态大语言模型(MLLM)在长思维链推理中,当不同知识来源给出冲突信号时常常失败。我们在统一的知识冲突概念下形式化这些失败,区分输入层客观冲突与过程层有效冲突。通过探测内部表征,我们揭示:(I) 线性可分性:不同冲突类型被显式编码为线性可分的特征而非相互纠缠;(II) 深度定位:冲突信号集中于中后层,表明存在专门的冲突编码处理阶段;(III) 层级一致性:沿轨迹聚合含噪的词元级信号可稳健恢复输入层冲突类型;(IV) 方向不对称性:在冲突下强化模型隐式的来源偏好远比强制其转向另一来源容易。我们的发现为知识冲突下的多模态推理提供了机制层面的视角,并使对长思维链失败的原理性诊断与控制成为可能。

诊断多模态长链推理中的知识冲突
图1:知识来源与冲突类型概览。我们将知识分为视觉知识(𝒦_vision)、文本知识(𝒦_text)和参数先验(𝒦_prior)。当来自不同来源的事实性陈述作为互不相容的信号时,便产生知识冲突。我们定义了三种主要冲突类型:视觉-文本(𝒞_VT)、视觉-先验(𝒞_VP)和先验-文本(𝒞_PT)。