论文

HealMed:大语言模型 医学多语言评估

HealMed: Multilingual Evaluation of Large Language Models in Medicine

模型评测基准与评测资源

摘要

我们推出 HealMed,这是一个经过专家评审的基准,用于医学领域 大语言模型 的多语言评估。 HealMed 包含 9 种语言中每种语言的 1,000 个示例,这些示例取自 9 个数据集,涵盖三种任务格式:MCQA、NLI 和开放式 QA。该基准由来自 9 个国家和地区的 23 名医生和医学专家历时两年制定。每个翻译均由两位精通英语和相应目标语言的专家进行评估和修订。在 HealMed 上,低资源语言的性能下降幅度最大,尽管不同语言和模型之间的差距大小存在显着差异。最强大的专有模型在各种语言中都是最稳定的,而许多开源和医学专业模型则表现出更大且不太一致的差距。仅靠医学专业化并不能确保多语言的稳健性。此外,专家修订可能会提高或降低测量的性能,这表明翻译质量会对跨语言评估结果产生重大影响。