论文

MMed-Bench-IR:多语言医疗信息检索的异构基准

MMed-Bench-IR: A Heterogeneous Benchmark for Multilingual Medical Information Retrieval

模型评测基准与评测资源

摘要

临床环境中的检索增强生成(RAG)越来越需要针对以英语为主的证据语料库进行多语言检索。多语言医学检索需要三种能力:跨语言对齐、概念辨别和证据检索。然而,现有的基准仅对这些进行孤立评估,而无法衡量生物医学专业知识和多语言覆盖范围之间的相互作用。我们引入了 MMed-Bench-IR,这是一个旨在跨 6 种语言和三种结构异构任务理清这些轴的基准:(1) 基于统一医学语言系统 (UMLS) 的跨语言医学 QA 检索,包含 6,127 个查询,(2) 三个难度级别的 4,975 个混淆集的概念辨别,以及 (3) RAG 的多语言证据检索,包含 2,040 个有质量保证的查询。这三个任务在设计上共享零概念和查询重叠,确保总分反映真正的能力广度。对六个范式家族的十个系统的评估揭示了严重的跨语言失败:英语得分为 0.818 nDCG@10 的生物医学编码器在日语中下降到 0.056,这是纯英语基准无法检测到的差距。