论文
OpenMedReason:医学视觉语言模型的科学推理监督
OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models
摘要
大型视觉语言模型 (LVLM) 的高风险临床使用需要基于视觉证据和临床知识的推理,而不仅仅是正确的最终答案。我们引入了 OpenMedReason,这是一个大规模、开放的多模式医学推理语料库,包含大约 45 万个图像-问答实例,其推理轨迹主要源自精心策划的生物医学、人类撰写的科学文章。 OpenMedReason 提供超越合成思维链的高保真监督,涵盖多种医学领域视觉模式,例如放射扫描、显微图像、可见光照片、图表等。我们用 OpenMedReason-Bench 对其进行补充,这是一个保留的基准,允许沿着三个互补的能力轴(包括感知、医学知识和基本原理)对 LVLM 进行细粒度评估,从而实现超越最终答案准确性的诊断评估。 OpenMedReason 是一个丰富的训练资源,在监督 微调 (SFT) 和基于强化的对齐方面展示了其有效性。使用 OpenMedReason 进行训练后,VQA 准确度比基本模型平均提高了 20%,并且性能与最强的可比规模医疗 LVLM 相比在 4.2% 以内。细粒度的性能分析证实,收益并不集中在任何单个轴上:OpenMedReason 共同提高了感知、医学知识和基本原理,并且在 86.1% 的成对比较中,其推理痕迹优于基本模型的推理痕迹。我们在huggingface.co/datasets/neginb/OpenMedReason 上发布了代码和数据集。