论文
使用器官条件模式标记进行细粒度视觉语言预训练,以实现 CT 理解
Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding
摘要
根据配对卷和放射学报告进行计算机断层扫描 (CT) 视觉语言预训练是一项可扩展但具有挑战性的任务。现有方法通常采用全局扫描报告对比,这种方法是可扩展的,但掩盖了异质器官证据。同时,直接的器官水平对齐仍然很粗糙,因为相同的解剖结构可以表现出多种不同的放射学外观。因此,预训练需要一个更精细的对齐单元:器官调节的放射图案。在这项工作中,我们提出了 OCP-CT,一种用于 CT 视觉语言预训练的器官条件模式标记对齐框架。具体来说,OCP-CT 保留了稳定的全局 CT 报告对比分支,并引入了器官模式接口:稀疏专家混合 (MoE) 根据潜在放射学模式路由图像和文本标记,可学习槽将路由标记查询为连续模式标记,配对标记对比将图像-文本模式标记与根据报告衍生的临床相似性构建的结构化软目标对齐。在公开的 CT-RATE 和 RAD-ChestCT 基准上,OCP-CT 的零样本异常诊断平均 AUROC 分别为 84.5% 和 69.9%。与之前报告的最强结果相比,这些结果产生的 AUROC 绝对收益分别为 6.7 和 0.8 个百分点。