论文
EDCT-Bench:通过解释驱动的反事实测试揭示 VLM 中的忠实度差距
EDCT-Bench: Uncovering Faithfulness Gaps in VLMs via Explanation-Driven Counterfactual Testing
摘要
视觉语言模型 (VLM) 可以生成自然语言解释 (NLE),这些解释听起来似乎合理,但与它们引用的视觉证据仍然不一致。我们提出了解释驱动的反事实测试(EDCT),这是一种基于干预的协议,它提取模型解释中引用的视觉概念,对其应用经过验证的最小编辑,并测试生成的答案和解释是否与编辑的图像保持一致。使用该协议,我们创建了 EDCT-Bench,这是一个涵盖三个互补领域的综合基准:知识密集型视觉问答 (OK-VQA)、安全关键驾驶 (DriveLM) 和 3D 空间推理 (3DSRBench)。在评估的 VLM 中,EDCT 揭示了巨大的忠实度差距,模型经常产生与经过验证的视觉变化不一致的响应。最后,我们的微调研究表明 EDCT 生成的反事实提供了高影响力的训练信号。