论文

重新思考大视觉语言模型中胸部 X 光推理的视觉归因

Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models

模型评测模型行为与机制分析

摘要

大视觉语言模型 (LVLM) 在医疗应用中显示出前景,但它们无法忠实地根据视觉证据做出反应,引发了人们对临床可信度的严重担忧。虽然视觉归因方法广泛用于解释 LVLM 预测,但这些解释是否真正反映了模型决策背后的视觉证据在很大程度上未经验证,因为用于内部模型推理的 真值 注释通常不可用。我们通过开发一个因果评估框架来解决胸部 X 光 (CXR) 推理的问题,该框架仅保留 CXR-VQA 样本,通过反事实编辑验证专家注释区域,以便对模型的预测负有因果责任。在 11 种归因方法、6 种开源 LVLM 和两种输出模式(直接答案和逐步推理)中使用该框架,我们发现现有的归因方法通常无法识别 LVLM 所使用的证据。为了解决这一问题,我们提出了 MedFocus,这是一种基于概念的归因方法,通过不平衡的最佳传输来定位具有临床意义的解剖区域,并通过有针对性的干预措施来衡量其对模型输出的因果影响。 MedFocus 产生空间、概念级和 词元级 归因,并且大大优于先前的方法,朝着更值得信赖的医学 LVLM 归因迈出了一步。我们的数据和代码可在 https://github.com/gzxiong/medfocus/ 获取。