论文

HalluCXR:用于胸部X光片解读的医学视觉语言模型的基准测试和减轻幻觉

HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 越来越多地用于医学图像解释,但它们经常产生幻觉,产生临床上合理但实际上不正确的结果,从而直接造成患者安全风险。我们引入了 HalluCXR,这是一个基准测试,可评估 856 张分层 MIMIC-CXR 胸部 X 光片和三种查询类型中的 6 个架构不同的 VLM,产生 15,408 个模型评估。具有临床严重程度评级的八类幻觉分类法和两层检测管道针对 250 个人类注释进行了验证(自动检测 F1=0.959;LLM 判断 F1=0.907)。我们发现 61.9--82.3% 的输出包含幻觉,其中临床危险错误高达 80.2%。出现了三种关键模式:正常的放射线照片反而会引起最严重的幻觉,常见的发现被系统性地过度捏造,而罕见的发现却未被充分发现,仅反应长度就可以预测幻觉风险(AUC高达0.908)。六模型集成可减少高达 84.8% 的制造量,但代价是遗漏量增加;三模型子集以一半的成本保留了相当的性能。这些结果表明,幻觉审计、基于详细程度的风险监控和基于整体的安全层是临床部署的先决条件。