论文
多模态 大语言模型 能理解 OCT 吗?
Can Multimodal Large Language Models Understand OCT?
摘要
光学相干断层扫描(OCT)成像对于视网膜疾病的诊断和治疗至关重要。尽管多模态 大语言模型 (MLLM) 在医学图像分析中表现出了巨大的潜力,但现有的基准在很大程度上将 OCT 理解降低到粗粒度的疾病分类或孤立的视觉问答,使得从视觉感知到临床推理的完整认知过程得不到充分评估。为了解决这一限制,我们引入了 OCT-Bench,这是一个致力于 OCT 图像理解的综合基准。 OCT-Bench 包含 10,076 个高质量多项选择题,这些问题由七个公共数据集中的 4,137 张 OCT 图像构建而成。遵循现实世界的临床解释工作流程,我们建立了一个分层能力分类法,由跨三个维度的 20 个细粒度任务组成:感知、认知和推理。这些任务涵盖广泛的功能,包括成像属性、视网膜解剖结构、病变特征、空间关系、疾病评估、治疗决策和预后管理。我们系统地评估了 20 个具有代表性的 MLLM,包括专有模型、开源通用模型和医疗领域模型。实验结果表明,当前模型仍然远远缺乏可靠的 OCT 理解。此外,医疗领域的适应和模型规模的增加都无法持续提高跨能力水平的性能。 OCT-Bench 能够对 MLLM 进行全面、细粒度的评估,为识别能力瓶颈和推进基于临床的 OCT 理解奠定基础。