论文
OphIn-500K:策划用于缩放眼科多模态的网络规模视觉说明 大语言模型
OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models
摘要
普通医学多模态 大语言模型 (MLLM) 的进步显示出构建会话助理以支持临床诊断的巨大潜力。然而,它们对眼科等高度专业化领域的适应仍未得到充分探索,这主要是由于缺乏大规模、特定领域的指令调整数据。现有的对话代理眼科数据集通常规模有限,并且很大程度上依赖于已建立的公共基准的图像,限制了眼科 MLLM 的可扩展性及其捕获现实世界临床复杂性的能力。为了解决这一差距,我们提出了 $\textbf{OphIn-Engine}$,这是一种眼科特定的指令数据管理管道,可从开放访问眼科网络规模视频构建高质量的指令数据。该管道集成了用于提取图像转录对的多模态转录、用于识别临床相关视觉描述的视觉提示分离和评分,以及用于生成准确和多样化的临床对话的质量控制的指令合成。使用该引擎,我们引入了 $\textbf{OphIn-500K}$,这是一个大规模多模态眼科指令调整数据集,包含超过 500,000 个指令实例和来自超过 29,000 个视频剪辑的超过 151,000 个独特图像,格式为视觉问答 (VQA)、多轮对话交互和思想链 (CoT) 推理。在此数据集的基础上,我们进一步开发了 $\textbf{OphIn-VL}$,这是一种具有高级视觉理解和对话功能的眼科专用 MLLM。综合实验和案例研究表明,与最先进的普通医学和特定领域 MLLM 相比,OphIn-VL 具有卓越的性能。