论文

CRAFT:医学视觉语言模型中的因果责任和故障追踪

CRAFT: Causal Responsibility and Failure Tracing in Medical Vision Language Models

模型评测模型行为与机制分析

摘要

随着视觉语言模型越来越多地应用于临床诊断,了解它们如何在内部解决竞争的视觉和文本信号成为安全当务之急。现有的机械分析仍然局限于单模态文本,并且没有解释为什么单个误导性句子可以推翻基于图像的正确诊断,或者为什么模型在视觉证据不足的情况下仍致力于给出自信的答案。我们发现,文本上下文优先于视觉基础的仲裁失败和模型在没有足够证据的情况下犯下的刹车失败这两种安全风险是由空间上不相交的注意力头群体介导的:仲裁头形成反映跨层证据竞争的中深层宽带,而刹车头集中在狭窄的中后期带,调节证据充分性和弃权行为。为了将这些观察结果建立在因果电路中,我们引入了 CRAFT,它通过双重标准将每种故障模式定位到最小因果头集,并通过时间探针和调谐透镜轨迹分析来验证必要性和充分性。切除仲裁头可大幅减少冲突,而清洁输入的退化可忽略不计,而切除制动头可在退化的视觉证据下恢复适当的弃权。这两种干预措施针对空间上不相交的耳机组,并产生明显的纠正效果,强调了故障模式的机械可分离性。跨多个医疗 VQA 基准和 VLM 架构的实验验证了定位和干预措施,证明所识别的头部因果驱动每种故障模式,并且有针对性的调制无需重新训练即可概括。该代码可在 https://github.com/zhcz328/CRAFT. 获取