论文
学习多少,而不仅仅是学习什么:CT 视觉语言预训练的跨患者负担顺序
Learning How Much, Not Just What: Cross-Patient Burden Order for CT Vision-Language Pretraining
摘要
体积 CT 视觉语言预训练从扫描报告对中学习 3D 表示,但全局和解剖感知目标仅监督对应关系:它们确定存在的内容并留下多少不受约束的内容。没有什么可以将同一发现的轻微病例与沿着一致方向的广泛病例区分开来,因此报告中的分级负担语言崩溃为存在/不存在的信号。纵向监督可以提供这种顺序,但与患者匹配的 CT 对在规模上是稀缺的;横断面队列已经对不同患者的微弱负担线索进行了编码。我们引入了 Spectrum,这是一个以解剖学为条件的框架,代表了整体研究和器官范围内的每项研究。对于每个器官映射的病理学,基于规则的评分器挖掘置信度过滤的从低到高的不同患者对,并且负荷方向对齐(BDA)将每个范围内的病理条件图像增量与报告增量对齐,将该方向与其相反方向分开。由于终点是不同的人,目标条件对准器首先使它们具有可比性,因此增量反映了负担而不是患者之间的差异。 BDA 进一步将所选方向与其反向分开,将其锚定到观察到的更高负担端点,并强制有序三元组之间的一致性。由于每一对都是在单一病理内绘制的,因此 BDA 旨在限制仅图像报告对比度永远无法触及的类内结构。 Spectrum 在 CT-RATE 上获得 85.6 的零样本 AUROC,在外部 RAD-ChestCT 上获得 72.7,在线性探测和检索方面具有一致的增益。因此,弱跨患者顺序是对解剖感知对应的可扩展补充,无需纵向数据即可产生负担感知 CT 表示。