Lumen:零样本计算病理学预训练视觉和语言编码器的参数高效对齐
Lumen: Parameter-Efficient Alignment of Pretrained Vision and Language Encoders for Zero-Shot Computational Pathology
摘要
病理视觉语言模型通常是通过对成对的图像描述数据进行预训练或微调大型编码器来构建的。我们询问是否可以通过冷冻单峰基础模型的参数有效对齐来组装病理学视觉语言模型,而不影响其预训练的表示。在这里,我们介绍 Lumen,它使用 4 级适配器和投影头来对齐冻结的 Virchow2 和 BioMedBERT 主干,仅训练公共 QUILT-1M 语料库上总参数的 0.40%。在九个公共零样本补丁基准测试中,Lumen 实现了最高的平均机会校正平衡精度,为 0.546,而最强基线为 0.461(配对差异 0.086,95% CI 0.042-0.136)。在淋巴结转移检测方面,Lumen 在 4,214 个保留的内部载玻片上达到了 0.964(95% CI 0.956-0.971)的 AUROC,在 9 个外部队列和 6 个器官的 2,368 个载玻片上达到了 0.955(95% CI 0.942-0.966)。在内部校准阈值下,它优于所有视觉语言基线,内部平衡准确度为 0.909 (95% CI 0.896-0.923),外部平衡准确度为 0.915 (95% CI 0.902-0.929)。 Lumen 在所有评估中都表现出竞争力,但跨模式检索除外,它在 CONCH 和 PathGen-L/14 之后排名第三。尽管改进了检索,但对两个编码器进行完全微调,Lumen 并没有比低秩自适应获得一致的好处。因此,对齐冻结的单峰基础模型可以在补丁和幻灯片级别产生强大且可转移的性能,同时仅训练一小部分参数。