论文

VOLMO:眼科多功能开放式大型模型

VOLMO: Versatile and Open Large Models for Ophthalmology

模型训练预训练

摘要

视力障碍影响着全球数百万人,早期发现对于防止不可逆转的视力丧失至关重要。眼科工作流程要求临床医生整合医学图像、结构化临床数据和自由文本注释来确定疾病的严重程度和管理,这既耗时又繁重。最近的多模态 大语言模型 (MLLM) 显示出良好的前景,但现有的普通和医用 MLLM 在眼科领域表现不佳,而且很少有眼科专用 MLLM 是公开可用的。我们提出了 VOLMO(眼科多功能开放大型模型),这是一个与模型无关、数据开放的框架,用于开发眼科特定的 MLLM。 VOLMO 包括三个阶段:对来自 82 种期刊的 26,569 篇文章的 86,965 个图像文本对进行眼科知识预训练;域任务 微调 涉及 26,929 个带注释的实例,涵盖 12 种眼部疾病,用于疾病筛查和严重程度分类;对 913 例患者病例报告进行多步骤临床推理,以进行评估、规划和后续护理。使用该框架,我们训练了一个紧凑的 2B 参数 MLLM,并将其与强大的基线进行了比较,包括 InternVL-2B、LLaVA-Med-7B、MedGemma-4B、MedGemma-27B 和 RETFound。我们在图像描述生成、疾病筛查和分期分类以及评估和管理生成方面评估了这些模型,并由两名医疗保健专业人员进行了额外的手动审查,并对三个独立队列进行了年龄相关性黄斑变性和糖尿病视网膜病变的外部验证。在各个设置中,VOLMO-2B 始终优于基线,实现了更强的图像描述性能,在 12 种眼睛条件下的平均 F1 为 87.4%,并且在外部验证中得分更高。