论文

谁驱动 VLM 的概率游戏?时间因果驱动评估框架

Who Drives the Probability Game of VLMs? A Temporal Causal Drive Evaluation Framework

模型评测评测方法与指标

摘要

视觉语言模型 (VLM) 越来越多地在复杂的图像和视频理解任务上进行评估,但传统指标主要评估最终答案的质量,而很少揭示不同信息源如何影响生成过程。我们提出了一个因果和时间评估框架,用于追踪自回归解码过程中视觉输入、问题文本和生成的前缀的演变角色。基于结构因果模型,我们使用干预措施和后门调整来导出三个步骤索引的因果驱动指标——视觉因果驱动(VCD)、问题因果驱动(QCD)和前缀因果驱动(PCD)——用于表征特定源的生成模式,而不需要参考答案。 Qwen3-VL-8B-Instruct 跨 MAVIS、LLaVA-Video-178K 和 MiraData 的实验,以及 InternVL2-8B 上的跨模型验证,揭示了从更强的早期问题和视觉指导到增加对生成前缀的依赖的一致转变。随机干预验证表明,QCD 和 PCD 相对于观察 PMI 基线的恢复误差分别减少了 34.8% 和 47.1%。在 VLMBias 上,前缀-视觉不平衡得分达到 0.767 AUROC 和 0.873 AUPRC,以区分先验驱动和视觉基础的世代。这些结果表明,因果驱动轨迹为多模式生成提供了补充的源级诊断。