论文
审核胸部 X 光片上的医学视觉语言模型:估计机构间的参考一致性
Auditing Medical Vision-Language Models on Chest Radiographs: Estimating Reference Agreement Across Institutions
摘要
视觉语言模型通过不暴露置信度分数的界面返回结构化的胸部X光检查结果,因此接收机构无法读出个人判断的信任程度。与机构参考标准的一致性是否会跨站点、发现、预测方向和问题格式转移,很大程度上是无法衡量的。我们评估了基于三个机构胸部放射线照片语料库的三个生成视觉语言模型以及两个启发协议下的六个发现,其中包括超过 345,000 个发现级别的预测,并根据当地标签的小预算估计了接收机构的按方向发现参考协议。然后,在反复严格的机构评估下对估计策略进行压力测试。在将接收机构完全排除在开发之外的评估下,设计承认的七个估计器中的自适应选择并没有改善简单的固定替代方案:它的平均 Brier 分数为 0.1083,而始终使用 Beta 二项式经验贝叶斯估计器的平均 Brier 分数为 0.0853,仅目标逻辑模型的分数为 0.0855。这两者相差 0.0003,小于该系列本身对求解器版本更改的敏感度,并且各自领先大约一半的设置,因此不建议使用默认值。与跨机构汇集的估计器相比,它们的优势集中在一个地点,一旦按机构聚集,就不再具有确认性,并且名义上 95% 水平的插件经验贝叶斯后验预测计数区间覆盖了 87.0%,在最难的机构中覆盖率更低。因此,必须根据站点和接口重新评估参考协议;这些结果涉及与机构标签的一致性,而不是临床正确性。