论文
解决缺失的第一步:VLM 能否标准化原始异构医疗数据?
Solve the Missing First Step: Can VLMs Standardize Raw Heterogeneous Medical Data?
摘要
随着视觉语言模型(VLM)越来越多地应用于医疗人工智能,现有的基准主要集中于评估其对给定医学图像和文本的诊断能力,隐含地假设标准化的医学图像、文本或问答对已经准备好。然而,当我们在实际临床实践中应用 VLM 时,这种假设并不成立,因为临床实践中的医疗数据通常是原始的、异构的且分散在不同的来源中。在本文中,我们研究了这个缺失的步骤,即原始医疗数据标准化。具体来说,为模型提供原始数据集文件夹,并评估其识别源格式、将原始医学图像转换为 VLM 兼容的视觉输入、提取相关文本信息以及将结果组织为结构化图像文本对的能力。为了构建此医疗数据标准化基准 (MDS-Bench),我们手动注释了 1,939 个原始医疗数据标准化任务,涵盖不同的临床实践、放射学模式、注释格式和目录布局。大量实验表明,即使性能最好的 VLM,即 Gemini 3 Flash,也只能实现 48.6% 的端到端成功率。我们的研究强调原始医疗数据标准化是实际实践中医疗人工智能诊断的关键瓶颈。