论文

从提示到标记:在多图像因果推理的视觉语言模型中内化因果监督

From Prompts to Tokens: Internalizing Causal Supervision in Vision-Language Model for Multi-Image Causal Reasoning

模型架构Transformer

摘要

视觉因果推理对于理解和干预物理世界至关重要,需要从视觉输入中识别因果变量并对干预效果进行推理。尽管最近取得了进展,大型视觉语言模型(VLM)在此类任务中仍然很脆弱,特别是对于多图像输入的干预和反事实查询。大多数现有的探索都是通过文本提示注入因果知识,将因果机制置于模型执行之外,并限制了推理过程中的可靠控制。为了解决这个问题,我们提出了 BridgeVLM,它通过从多图像输入中归纳因果图并将其转换为由注入 LLM 解码器的 RAMP 层执行的结构化因果词元来内部化视觉因果推理,以进行因果消息传递。我们进一步引入了统一的训练接口 M3S,用于不同粒度(局部/全局级别)的细粒度因果监督。 BridgeVLM 在 CausalVLBench 上的干预任务准确率达到 54.4%(相比之下,提示级监督为 33.2%),将 Causal3D 上的结果从 43.6% 提高到 49.0%,并显着改善 CausalVLBench 上的因果结构学习($F_1$: 33.4% $\rightarrow$ 75.1%)。