论文

FFM-CP:少样本计算病理学视觉语言基础模型的跨主干融合

FFM-CP: Cross-Backbone Fusion of Vision-Language Foundation Models for Few-Shot Computational Pathology

应用与实践行业应用

摘要

病理学视觉语言基础模型的性能因疾病和任务而异,没有单一模型始终表现最佳。专家病理学注释的高成本也会限制可用于特定任务适应的标记数据。结合互补的预训练表示是解决这些限制的一种潜在方法,但从少数标记示例中学习有效的融合仍然具有挑战性。我们介绍了计算病理学的少样本融合基础模型(FFM-CP),这是一个在少样本学习环境中结合了多个病理视觉语言模型的框架。该框架首先使用从相应支持图像估计的封闭形式正交普罗克拉斯特变换来对齐异构表示。这种对齐方式保留了模型内的特征几何形状,无需训练额外的对齐网络。在对齐的空间内,统一的图通过联合细化支持图像特征以及视觉和文本类原型来实现跨主干网的信息交换。这些精致的表示支持互补的文本原型和案例检索分支,分别捕获语义类知识和类内视觉变化。每个分支学习结合来自所有有序骨干对的预测,允许由一个模型编码的查询利用另一个模型代表的证据。我们评估了六个组织病理学数据集上的三种骨干组合,每类有 4、8 和 16 个镜头。在 54 次比较中的 50 次中,FFM-CP 比每个融合集中最强的单独适应成员实现了更高的平均宏 F1。这些发现表明,当注释有限时,结合互补的预训练表示可以改善组织病理学分类。