MEDLAYXPLAIN:医学视觉语言模型中专家差距的基准测试
MEDLAYXPLAIN: Benchmarking the Expert-Lay Gap in Medical Vision-Language Models
摘要
医学视觉语言模型 (Med-VLM) 实现了强大的专家级性能,但其生成患者可访问的描述的能力仍未得到充分探索。随着《21 世纪治愈法案》现在要求患者立即获得诊断成像结果,评估 Med-VLM 是否可以弥合专家与外行之间的差距对于患者教育和共同决策来说既紧迫又具有临床意义。为此,我们推出了 MedLayXPlain,这是第一个用于医学外行语言生成(MLLG)的大规模多模式基准和评估框架。 MedLayXPlain-122K 提供了来自 12 个公开源数据集的 8 种成像模式的 122,789 个基于区域的样本,每个样本都包含一张医学图像,以及配对的专家和面向非专业人士的描述,锚定在三级统一医学语言系统 (UMLS) 本体层次结构中,涵盖 7 个语义组、43 种语义类型和 2,411 个医学概念。外行字幕是通过分层本体验证细化 (HOVER) 构建的,这是一个三步管道,结合了以患者为中心的词汇映射、基于 LLM 的约束重写和跨模型视觉验证,以强制语义等效,同时防止幻觉。我们进一步介绍了 MedLayEval,这是一种从 27B 验证器中提炼出来的轻量级 3B 评估器,可对五个具有临床依据的属性进行专家级对齐评分,解决标准 NLG 指标与临床判断之间相关性较差的问题。对 MedLayXPlain-122K 上的 33 个 VLM 进行基准测试揭示了系统性的专家与外行差距:医疗 VLM 实现了强大的专家字幕,但外行记录性能显着下降,而通用 VLM 产生更易于理解的语言,但缺乏临床精度,这证实当前的范式都无法充分服务于面向患者的通信。