论文
没有参与的感知:剖析 LMM 中的因果发现缺陷
Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs
摘要
尽管大型多模态模型(LMM)在一般视频理解方面取得了出色的表现,但它们在因果发现过程中对文本先验捷径的敏感性已被认为是一个严重缺陷。这种现象的根本机制仍不完全清楚,因为现有基准仅衡量响应准确性,而没有揭示赤字的来源和程度。我们引入了 ProCauEval,一种基于扰动的评估协议,它从结果评估转向机制诊断,通过五种受控配置探索因果发现,这些配置系统地操纵视觉和文本模式来分解它们各自对模型行为的贡献并剖析故障模式。通过评估 17 个主流 LMM,我们发现模型忠实地感知视频内容,但在因果推理过程中系统性地未充分利用它。我们进一步观察到,更强的 后训练 会放大而不是减轻文本先验依赖,并且更高的基线性能与扰动下更大的脆弱性相关。为了解决这些问题,我们提出了 Anti-蒸馏 策略优化(ADPO),这是一种建立在负教师对齐基础上的强化学习框架,它通过明确地将策略从视觉腐败引起的仅先验的反事实教师中推开,从而增强了 GRPO。具体来说,ADPO 最大化了以原始输入和视觉损坏输入为条件的策略分布之间的差异,从而迫使模型将其推理基于视觉证据而不是文本快捷方式。大量实验表明,ADPO 在不牺牲基本理解的情况下提高了视觉参与度,从而为可靠的因果发现迈出了第一步。