论文

不转移的安全性:可部署医学语言模型中的跨语言临床正确性漂移

Safety That Does Not Transfer: Cross-Lingual Clinical Correctness Drift in Deployable Medical Language Models

模型评测安全与风险评测

摘要

大语言模型 的安全评估主要以英语进行,并且主要在前沿系统上进行。这两种情况都没有描述在资源匮乏的健康环境中如何遇到此类模型,其中小型量化系统在本地运行并以本地语言进行查询。我们询问以英语建立的临床安全性是否会转移到豪萨语,以及任何失败是否可归因于语言、临床任务或低资源部署所承认的模型类别。针对尼日利亚北部三种高负担疾病建立了匹配的英语-豪萨语问题对:疟疾、镰状细胞病和结核病、探索性知识回忆、紧急分类、引发禁忌行为的引导性问题以及传统疗法主张。评估了六种模型:五个具有 4-90 亿个参数的本地可部署系统、两个医学微调系统和一个前沿系统。所有 128 份回复均由两名操着流利豪萨语的人根据尼日利亚国家治疗指南进行评分,他们独立工作且彼此不知情。在可本地部署的模型中,平均临床正确性从英语的 1.57 下降到豪萨语的 -0.03,其中 2 表示正确答案,-1 表示严重有害的答案。前沿模型从 2.00 移动到 1.75,并且在任何一种语言中都没有产生被认为有害的响应。所有三种条件下的漂移都是一致的。评估者之间的一致性对于临床正确性而言非常重要(kappa = 0.70);最初对伤害的一致性较差(kappa = 0.22),并进行了详细检查。因为前沿模型在豪萨语中能够胜任地回答相同的问题,所以缺陷既不是语言的属性,也不是临床材料的属性,而是可部署层的属性。