论文

学习计算机断层扫描中鲁棒的视觉特征可以实现临床任务的高效迁移学习

Learning Robust Visual Features in Computed Tomography Enables Efficient Transfer Learning for Clinical Tasks

模型训练预训练

摘要

人们对开发人工智能系统以支持放射科医生执行从分割到报告生成等任务的浓厚兴趣。现有的计算机断层扫描 (CT) 基础模型主要侧重于构建能够执行问答和报告生成等任务的通用视觉语言系统。然而,训练可靠的视觉语言系统需要成对的图像文本数据,其规模在 CT 中仍然无法实现。此外,使底层视觉表示适应下游任务通常需要部分或全部主干 微调,这是许多研究小组无法实现的计算要求较高的过程。相反,基础模型应该优先考虑学习强大的视觉表示,从而能够使用最少的标记数据有效地转移到新任务,并且无需骨干 微调。我们提出了 VoxelFM,这是一种使用 DINO 框架使用自 蒸馏 进行训练的 3D CT 基础模型,它可以在没有语言监督的情况下学习语义丰富的特征。我们使用带有轻量级探针的冻结主干表示来评估七类临床相关下游任务的 VoxelFM:分类、回归、生存分析、实例检索、本地化、分割和报告生成。 VoxelFM 在所有任务类别中均匹配或优于四种现有的 CT 基础模型。尽管在 预训练 期间没有受到语言监督,VoxelFM 仍然超越了经过语言对齐目标明确训练的模型,包括在报告生成方面。我们的结果表明,当前的 CT 基础模型作为轻量级探针的特征提取器比作为视觉语言模型的视觉编码器表现得更好。模型权重和训练代码是公开的。