论文

RadPRISM:模式分层放射学报告监督,用于概念分离的图像表示和视觉基础

RadPRISM: Schema-stratified radiology-report supervision for concept-disentangled image representations and visual grounding

模型训练预训练

摘要

视觉语言预训练从放射学报告中学习丰富的医学图像表示,但以前的模型变体通常在单个共享嵌入空间内运行,因此必须事后恢复概念级结构和可解释性,从而限制了模型透明度,从而限制了临床实用性。我们引入了 RadPRISM,它使临床医生定义的放射学方案成为指定的分层轴:本地 大语言模型 从自由文本报告中提取每个概念的文本范围,每个临床概念在其自己的专用视觉子空间中对齐,将概念分层转变为直接的顶级对齐监督。在胸片上实例化了来自内部多年档案的 19 概念模式超过 $203{,}602$ 检查,RadPRISM 将内部数据集零样本分类从 $0.717$ (95% CI, $0.710-0.723$) 提高到 $0.868$ (95% CI, $0.863-0.872$) 宏观 AUROC 超过匹配的全局对齐基线,在外部零样本分类中的表现与专门构建的 CARZero 参考相当,而在指点游戏视觉基础方面远远优于它(高达 4.3 倍)。此外,放射科医生读者研究证明了概念分层检索能力(3 级内的宏观检索正确率为 0.78),呈现出报告级检索和固定标签词汇无法表达的解开的描述性发现。 RadPRISM 产生有辨别力的、空间忠实的、本地概念分层的表示,由临床医生塑造并透明地检查。