论文
通过代理变量揭示基于 LLM 的急诊分诊中的潜在偏差
Uncovering Latent Bias in LLM-Based Emergency Department Triage Through Proxy Variables
摘要
大语言模型(LLM)的最新进展使其得以融入临床决策;然而,针对不同种族、社会、经济与临床背景患者的隐性偏见依然存在。本研究考察应用于急诊(ED)分诊的基于 LLM 的医疗 AI 系统中的偏差。我们采用 32 个患者级代理变量,每个变量由成对的正面与负面限定词表示,并在适当的情况下使用公开(MIMIC-IV-ED Demo、MIMIC-IV Demo)与受限制的凭证访问(MIMIC-IV-ED 与 MIMIC-IV)数据集评估其影响。我们的结果显示,在急诊分诊场景中存在经由代理变量介导的歧视性行为,以及一种系统性倾向:当特定 token 出现在输入上下文中时,无论其被正面还是负面表述,LLM 都会修改对病情严重程度的感知。这些发现表明,AI 系统仍在含有噪声、有时非因果的信号上训练,这些信号并不能可靠反映患者真实的紧急程度。因此,要确保 AI 技术在临床环境中的安全负责任部署,仍需做更多工作。
