论文
用于 CT 视觉语言学习的语义校准证据组合
Semantically Calibrated Evidence Composition for CT Vision-Language Learning
摘要
从 CT 报告对中学习可转移的表示需要将全卷上下文与特定解剖证据相结合。现有方法通常强调全局 CT 报告对齐或细粒度解剖级对应。全局对齐保留了广泛的研究背景,但隐含了局部证据的贡献,而解剖学水平对齐明确地基于局部发现,但没有指定独立表示的证据应如何相互作用,获取研究级别的意义,并有助于全局 CT 表示。为了解决这一差距,我们提出了 SCOPE(合成证据的语义校准),这是 CT 视觉语言学习中语义校准证据合成的框架。在特定器官的报告监督下,具有固定解剖身份的掩模引导查询从共享的、未裁剪的体积特征中提取上下文感知的器官证据,而不受限制的全局查询保留对整个体积上下文的访问。然后,全局查询驱动局部-全局耦合将器官证据组合成统一的证据表示。随后使用诊断摘要对合成的证据进行校准,提供超出局部器官描述的研究级语义监督,并最终作为受控残差整合到与完整报告一致的上下文保留的全卷表示中。这种渐进途径将本地证据与研究级语义联系起来,而无需将 CT 表示简化为一组预定义的器官。在 CT-RATE 和 RadChestCT 上,SCOPE 的宏观 AUC 分别达到 85.0 和 72.2,比之前的 SOTA 分别高出 7.2 和 4.2,同时在线性探测和跨模态检索方面也取得了显着的进步。这些结果证明了语义校准证据构成的有效性。