论文
CoM$^3$eT:通过联合、多维上下文集成进行医学图像分析的基础模型
CoM$^3$eT: A foundation model for medical image analysis through federated, multidimensional context integration
摘要
当使用有限的标记数据训练人工智能模型时,医学基础模型可以提高泛化能力,但仍然局限于单一专业,例如病理学或放射学,以及稀疏或密集的输出,例如分类或分割。在这里,我们提出了 CoM$^3$eT(共同表示多维多任务医学 Transformer),这是一种医学视觉基础模型,通过对多维上下文进行注意力建模,统一了病理学和放射学、稀疏和密集预测以及二维和高维输入。 CoM$^3$eT 在涵盖五个断层扫描、四个完整样本和三个二维数据集的公开竞赛中优于其他医学基础模型,涵盖稀疏和密集的预测任务以及报告生成。当适应不同的临床应用时,训练不到 2.5% 的参数即可实现与完整 微调 相当的性能,从而无需访问高性能 GPU 集群即可进行研究。这种方法应用于跨医院的联合学习,其性能可与通过互联网连接和消费级硬件进行的汇总数据训练相媲美。