论文

视觉语言模型中的推理动力学和监测模态依赖的局限性

Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models

模型评测模型行为与机制分析

摘要

视觉语言模型 (VLM) 的最新进展提供了推理功能,但这些功能如何展开和整合视觉和文本信息仍不清楚。我们分析了 18 个 VLM 中的推理动态,涵盖来自两个不同模型系列的指令调整和推理训练模型。我们跟踪思想链 (CoT) 的置信度,衡量推理的纠正效果,并评估中间推理步骤的贡献。我们发现模型很容易回答惯性问题,即早期对预测的承诺得到加强,而不是在推理步骤中进行修改。虽然经过推理训练的模型表现出更强的纠正行为,但它们的增益取决于模态条件,从文本主导到仅视觉设置。使用具有误导性文本提示的受控干预,我们表明即使视觉证据足够,模型也会始终受到这些提示的影响,并评估这种影响是否可以从 CoT 中恢复。尽管这种影响可能出现在 CoT 中,但其可检测性因模型而异,并且取决于所监视的内容。经过推理训练的模型更有可能明确引用线索,但它们较长且流畅的 CoT 仍然可以在看似以视觉证据为依据,而实际上遵循文本线索,从而模糊了模态依赖。相比之下,指令调整模型不太明确地引用提示,但它们较短的轨迹揭示了与视觉输入的不一致。总而言之,这些研究结果表明,CoT 仅提供了不同模式如何驱动 VLM 决策的部分观点,对多式联运系统的透明度和安全性具有重要影响。