论文
Aloe-Vision:用于医疗保健的强大视觉语言模型
Aloe-Vision: Robust Vision-Language Models for Healthcare
摘要
由于其在临床和生物医学应用中的潜在影响,专门用于医疗保健的大视觉语言模型(LVLM)正在成为一个有前途的研究方向。然而,由于高质量医疗多模式数据的稀缺、对安全关键环境中稳健性的担忧以及限制可靠评估的狭窄且可能受到污染的评估基准,进展受到限制。为了解决这些问题,该领域需要最先进的解决方案,即完全开放且可重复的系统,其中所有组件都可以进行检查、评估和改进。这项工作引入了 Aloe-Vision-Data,这是一种大规模的、经过质量过滤的混合物,它跨多模式和纯文本源集成了医学和一般领域,设计用于直接在模型 微调 中使用。在此数据集的基础上,我们以两个尺度(7B 和 72B)训练 Aloe-Vision 系列医学 LVLM,并公开发布完整权重、训练配方和数据。通过全面的基准测试,我们证明高质量的训练混合物可以产生平衡的 LVLM,在不影响一般能力的情况下,比基线模型产生显着的收益,从而实现与最先进的替代方案相比的竞争性能。为了支持可靠的评估,我们引入了 CareQA-Vision,这是一个精心策划的视力基准,源自 MIR 和 EIR 考试(西班牙医疗和护理专家的住院医师入学考试),提供新颖的视力问题,污染的可能性很小。最后,我们表明当前的 LVLM 仍然容易受到对抗性和误导性输入的影响,这凸显了临床环境中的可靠性挑战。