论文

从视觉到语言:研究多模式决策中的因果信息流

From Vision to Language: Investigating Causal Information Flow in Multimodal Decision-Making

模型评测模型行为与机制分析

摘要

视觉语言模型通常通过最终预测进行评估,但了解这些决策是否基于视觉证据需要追踪视觉信息如何促进基于语言的决策。考虑到这一目的,我们通过对视频文本注意路径应用分层因果干预来研究基于视频的生成式多项选择设置中的跨模式信息流。我们的目标是空间、因果和时间视觉推理。我们的结果表明,当模型处理候选答案选项时,视觉信息主要被整合,这些选项作为最终决策的主要文本基础。我们进一步表明,名词在多模态丰富过程中作为语义锚发挥着重要作用,而动词在处理时间关系时更相关。最后,我们在时间推理中发现了一种独特的模式,表明 VLM 很难重建跨视频帧的顺序信息,但我们指出,这种脆弱性也可能反映了与用于定义场景内事件之间关系的特定时间表达相关的语言偏差。