论文

放射学比较推理的视觉语言框架

A Vision-language Framework for Comparative Reasoning in Radiology

上下文与知识检索增强

摘要

医学成像人工智能在孤立图像解读方面取得了强劲的表现,但与放射学实践的一致性仍然较差,诊断和随访依赖于先前研究和类似参考案例的比较。在这里,我们将放射学比较表述为实体感知的跨图像推理问题,并引入一个支持参考案例检索和时间比较解释的框架。我们构建了 MedReCo-DB,这是一个源自常规图像报告对的大规模比较成像资源,包含来自 8 个机构、4 个国家和 7 种成像模式的 160,000 多名患者的 690,000 多张图像。报告被分解为解剖结构、异常发现和病理状况,为实体条件检索和比较视觉问答提供监督。利用这一资源,我们开发了 MedReCo(一种实体感知视觉编码器,用于临床类似病例的可控检索)和 MedReCo-VLM(一种用于间隔变化生成解释的视觉语言扩展)。在内部、外部和跨中心评估中,MedReCo 在所有 12 个内部检索设置中实现了最高的 Recall@1,并将外部检索平均提高了 6.0 个百分点。在临床上容易混淆的差异组中,它始终优于最强的基线。 MedReCo-VLM 在所有比较一代评估中均取得了最佳性能,并将胸部 X 光片纵向随访准确性提高了 14.5-46.5 个百分点,CT 上纵向随访准确性提高了 13.0-27.9 个百分点。这些发现表明,可以从大规模的常规临床数据中学习实体感知的比较推理,并可能为医学成像人工智能提供更加临床一致的基础。