论文
用于临床分诊的开源大语言模型中的偏差的反事实审计
Counterfactual Auditing of Bias in Open-Source Large Language Models for Clinical Triage
摘要
急诊科 (ED) 分诊是一项高风险优先级任务,其中人口统计、社会经济和系统背景信息可能会不适当地影响敏锐度分配。尽管开源大语言模型 (LLM) 越来越多地被考虑用于本地和隐私保护的临床决策支持,但仍不清楚反事实偏差在模型系列、规模、医学领域模型和领域适应模型之间如何变化。我们对十个开源大语言模型进行了儿科紧急严重指数 (ESI) 预测的比较反事实审计。从真实和手册式的临床小插图开始,我们构建了配对的反事实变体,这些变体仅改变一个注入的人口统计学、社会经济、医疗保健获取、行为、社会或系统背景变量,同时保持临床表现固定。模型包括 Qwen2.5-7B、Qwen2.5-14B-Instruct、QLoRA 微调 Qwen2.5-7B、MedGemma 变体、MedLLaMA2-7B、GPT-OSS-20B 和 GPT-OSS-120B。我们测量任何反事实偏移、分类不足、过度分类、大于一个 ESI 水平的偏移、平均偏移和平均绝对偏移。反事实敏感性差异很大,并且并不随着模型大小或医学领域预训练的增加而持续降低。经过微调的 Qwen2.5-7B 显示出最低的总体灵敏度,任意偏移率为 5.27%,平均绝对偏移为 0.0534,而基础模型为 16.02% 和 0.1706。几个较大的或医学领域的模型显示出更显着的变化。分层和相关分析进一步揭示了总发生率隐藏的临床重要方向性和共同失败模式。这些发现支持反事实审计作为一个轻量级的、临床可解释的框架,用于在临床部署之前比较开源大语言模型的公平风险。