论文

OphMAE:通过自适应眼科诊断的基础模型桥接体积和平面成像

OphMAE: Bridging Volumetric and Planar Imaging with a Foundation Model for Adaptive Ophthalmological Diagnosis

模型训练预训练

摘要

基础模型的出现预示着医学人工智能(AI)的新时代,使得能够从大规模未标记数据集中提取可概括的表示。然而,当前的眼科人工智能范式主要局限于单一模态推理,从而与诊断依赖于补充成像模态综合的临床实践产生不一致。此外,在资源有限的环境中部署高性能人工智能经常因无法获得先进的三维成像硬件而受到阻碍。在这里,我们提出了眼科多模态掩模自动编码器 (OphMAE),这是一种多成像基础模型,旨在将 3D 光学相干断层扫描 (OCT) 的体积深度与 2D enface OCT 的平面背景相协同。通过实施新颖的跨模态融合架构和独特的自适应推理机制,OphMAE 在包含来自 32,765 名患者的 183,875 幅配对 OCT 图像的海量数据集上进行了预训练。在涵盖 17 项不同诊断任务、来自 8,191 名患者的 48,340 幅配对 OCT 图像的严格基准测试中,该模型展示了最先进的性能,年龄相关性黄斑变性 (AMD) 的曲线下面积 (AUC) 为 96.9%,糖尿病性黄斑水肿 (DME) 的曲线下面积 (AUC) 为 97.2%,始终超越现有的单模态和多模态基础模型。至关重要的是,OphMAE 表现出强大的工程适应性:即使仅限于单模态 2D 输入,它也能保持较高的诊断准确性,例如 AMD 的 93.7% AUC,并通过在少至 500 个标记样本的情况下保留 95.7% AUC 来展示卓越的数据效率。这项工作为眼科人工智能建立了一个可扩展且适应性强的框架,确保跨不同任务的稳健性能。