论文

超越英语基准:巴西葡萄牙语的临床 LLM 评估

Beyond English benchmarks: clinical llm evaluation in Brazilian Portuguese

模型评测基准与评测资源

摘要

大语言模型正在改变对临床决策的支持及其在实际场景中的应用。然而,大多数基准都是用英语进行的,需要跨语言评估来解决全球访问中的语言差距。我们推出了 ClinicalBr,这是第一个根据巴西真实病例报告构建的临床决策双语基准。该语料库包含来自 28 种 SciELO 医学期刊的 2,892 个案例,涵盖 18 个专业,并采用平行的葡萄牙语-英语对的结构。每个病例支持四项评估任务:诊断检索、鉴别诊断、检查推荐和治疗计划。我们评估了两种语言的四种模型:MedGemma-27B、Sabiá-4、DeepSeek-R1 和 o3-mini。主要发现是葡萄牙语和英语的表现差距是任务相关的,而不是普遍的。在诊断检索中,英语在所有模型中都具有一致的优势,准确度为 +7.5-12.1 分。这种优势在鉴别诊断、检查建议和治疗计划中消失,其中大多数模型的置信区间为零,并且葡萄牙语完整性分数略高。事实证明,巴西流行的情况比完整语料库更容易,而不是更难,这表明当前的 预训练 充分代表了热带表现。考试推荐是所有模型和两种语言中最难的任务,F1 分数低于 0.10,远低于鉴别诊断上限 0.20-0.27。