论文

SHOVIR:评估放射学报告生成中视觉捷径学习的基准

SHOVIR: A Benchmark for Evaluating Vision Shortcut Learning in Radiology Report Generation

模型评测基准与评测资源

摘要

当前放射学报告生成 (RRG) 中视觉语言模型 (VLM) 的评估协议依赖于测量词汇重叠或汇总临床正确性的报告级指标。然而,此类指标并不能测试各个诊断陈述是否源于图像中可见的实际病理证据。这允许模型通过利用学习的先验或虚假相关性来获得有竞争力的分数,我们将这种失败模式称为视觉捷径。我们引入了 SHOVIR,这是评估 RRG 中视觉捷径行为的基准。 SHOVIR 使用每个框 CheXpert 标签扩展了两个空间注释的胸部 X 射线数据集 MIMIC-CXR 和 PadChest-GR,并定义了图像级和疾病级遮挡实验,将干净图像的基线性能与局部、区域特定的扰动进行对比。比较这些条件下的预测在疾病类别级别上隔离了两种失败模式:直接捷径,即在视觉证据被移除后发现仍然存在;以及上下文捷径,即一旦同时发生的病理被遮挡,尽管目标区域保持完整,检测结果就会下降。通过对八个最先进的 VLM 进行基准测试,我们发现快捷方式行为在架构和数据集之间存在很大差异。达到最高基线报告质量的模型不一定在空间定位方面排名最高,这表明临床流畅的生成可以与对视觉证据的浅度依赖共存。这些发现暴露了当前 RRG 评估中的盲点,并激发了区域感知评估协议。