论文

使用器官分层报告知识学习基于解剖学的 CT 视觉语言表示

Learning Anatomy-Grounded CT Vision-Language Representations with Organ-Hierarchical Report Knowledge

模型训练预训练

摘要

来自配对 CT 图像和放射学报告的医学视觉语言预训练 (VLP) 可以实现可扩展的表示学习,但大多数现有方法要么将整个扫描与整个报告对齐,要么将局部图像区域与文本片段对齐。这些表述没有充分利用放射学报告的一个关键特性:发现结果是围绕解剖结构组织的,并通过器官、疾病概念、位置和严重性相关属性描述异常。我们提出 OKA-CT,一种用于 CT 报告 VLP 的器官分层知识增强框架。 OKA-CT 首先使用放射学报告解析和 LLM 辅助语义结构将自由文本报告转换为器官条件知识。提取的层次结构用于两个学习阶段。第~1阶段通过细粒度的器官条件监督将基于解剖学的证据注入CT视觉表示中,而第~2阶段使用特定于器官的报告证据来指导结构化报告-CT对比学习,其中层次结构衍生的语义软目标将具有共享器官水平发现的非配对病例视为弱语义阳性而不是统一阴性。基于轻量级查询的全局分支进一步聚合与疾病相关的体积证据以进行全扫描表示。在 CT-RATE 和 RAD-ChestCT 数据集上,OKA-CT 实现了 84.9 和 72.2 的零样本异常诊断 AUROC,优于之前的 CT VLP 基线。检索和斑块遮挡分析进一步显示报告图像对齐得到改善,并且对疾病相关解剖区域具有更强的敏感性。