论文
EuropeMedQA 研究方案:用于语言模型评估的多语言、多模式医学检查数据集
EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation
摘要
虽然 大语言模型 (LLM) 在以英语为中心的医学检查中表现出很高的熟练程度,但在面对非英语语言和多模式诊断任务时,他们的表现往往会下降。本研究协议描述了 EuropeMedQA 的开发,这是第一个全面、多语言、多模式的医学检查数据集,源自意大利、法国、西班牙和葡萄牙的官方监管考试。遵循 FAIR 数据原则和 SPIRIT-AI 指南,我们描述了严格的管理流程和用于比较分析的自动翻译管道。我们使用零样本、严格约束的提示策略来评估当代多模态 LLM 来评估跨语言迁移和视觉推理。 EuropeMedQA 旨在提供一个抗污染基准,反映欧洲临床实践的复杂性,并促进更通用的医疗人工智能的发展。