论文

SurgCheck:视觉语言模型真的能观察外科 VQA 中的图像吗?

SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA?

模型评测基准与评测资源

摘要

目的:视觉语言模型(VLM)在手术视觉问答(VQA)中表现出了良好的性能。然而,现有的外科 VQA 数据集通常包含语言捷径,其中问题措辞隐式限制了答案空间。目前尚不清楚报告的表现是否反映了视觉理解或对这种语言捷径的依赖。方法:我们引入 SurgCheck,这是一种用于量化外科 VQA 中语言捷径依赖的诊断基准。 SurgCheck 采用配对问题设计,其中每个手术框架都与包含实体名称的原始问题和偏见较小的对应问题相关联,该对应问题删除了这些名称,同时保留相同的视觉内容和 真值 答案。由此产生的绩效差距提供了捷径依赖的诊断信号。为了确保即使没有实体名称,偏见较小的问题也能得到明确定义,引入了四个基础线索:边界框、箭头、空间位置和旁白。我们在 SurgCheck 上的零样本和微调设置下评估通用和手术专用 VLM。为了评估开放式零样本响应,我们引入了 LLM-as-a-judge 评估协议。结果:使用 SurgCheck,我们观察到,尽管视觉输入相同,但五个 VLM 中偏见较小的问题的性能始终下降。纯文本消融显示动作和目标预测的性能下降最小,这表明动作和目标预测很大程度上是由语言快捷方式而不是视觉推理驱动的。结论:SurgCheck 提供了一个受控诊断框架,可以暴露现有外科 VQA 基准中被语言偏差掩盖的故障模式。我们的研究结果表明,强大的基准性能并不一定意味着忠实的视觉理解,这强调了在外科 VQA 中进行偏差感知评估的必要性。