论文

超级通才:通过通才与专才的协同实现全面、准确的医学图像理解

Super-Generalist: Towards Comprehensive and Accurate Medical Image Understanding via Generalist-Specialist Synergy

模型训练预训练

摘要

医学图像需要全面、准确的解释来支持不同临床状况的诊断。最近的视觉语言通才模型提供了广泛的任务覆盖范围和有前途的零样本能力,但往往缺乏用于可靠诊断和空间解释的细粒度解剖和病变意识。相比之下,有监督的专家模型在特定任务上表现出色,但通常缺乏跨疾病和解剖学的泛化能力。在这项工作中,我们提出了 SuG,一个超级通才框架,它将通才视觉语言学习与专业目标结合起来,实现广泛的泛化和专家级的诊断能力。我们通过整合来自多个分割专家的空间先验,包括解剖学、特定类别病变和类别不可知的病变分割器,在 SuG 中执行专家增强的视觉语言对齐,这些分割器捕获训练期间注释的解剖结构之外的病变。为了提高病变定位能力,我们利用病变掩模作为空间先验来校准文本条件的视觉注意力,鼓励与疾病相关的语义关注临床相关区域。我们在广泛的胸部和腹部 CT 基准上评估 SuG,包括 CT-RATE、Merlin、MedVL-CT69K 和几个内部肿瘤数据集。 SuG 在广泛的疾病诊断任务中实现了最先进的性能,并在几个关键的肿瘤诊断基准上超越了专业模型。此外,SuG 表现出强大的病变定位能力,包括对缺乏特定类别监督的病变类型的强大泛化能力。