EQUITRIAGE:基于 LLM 的急诊科分类中性别偏见的公平审核
EQUITRIAGE: A Fairness Audit of Gender Bias in LLM-Based Emergency Department Triage
摘要
急诊科分诊为患者分配一个视力评分,以确定治疗的优先顺序,临床证据记录了人类视力评估中持续存在的性别差异。当医院试点 大语言模型 (LLM) 作为分诊决策支持时,一个关键问题是这些模型是否会重现或减轻已知的偏差。我们提出了 EQUITRIAGE,这是对基于 LLM 的 ESI 作业的公平性审计,评估了五个模型(Gemini-3-Flash、Nemotron-3-Super、DeepSeek-V3.1、Mistral-Small-3.2、GPT-4.1-Nano),在四种提示策略下对 18,714 个 MIMIC-IV-ED 小插图进行了 374,275 次评估。在 9,368 个原件中,有 9,346 个与性别互换的反事实配对。所有五个模型的翻转率均高于预先注册的 5% 阈值(9.9% 至 43.8%)。其中两个显示定向女性分类不足(DeepSeek F/M 2.15:1,Gemini 1.34:1);两者几乎持平;一种具有较高的敏感性,但男性方向的不对称性较弱。 DeepSeek 的方向性偏差与结果相关的低校准差距(相对于 MIMIC-IV 录取为 0.013)共存,这是组内校准和对间反事实不变性之间的 Chouldechova 式分离。人口统计致盲将 Gemini 的翻转率降低至 0.5%;保留年龄的盲变体使 DeepSeek 的残余 F/M 为 1.25,这表明年龄是残余通道。思想链导致所有五个模型的准确性下降。两种模型消融揭示了相同方向表型的相反的潜在机制:在 Gemini 中,信号出现在组合名称+性别交换中,而在 DeepSeek 中,性别标记单独携带它。 EQUITRIAGE 表明,群体平等、反事实不变性和性别校准是独特的公平属性,干预效果取决于模型,并且每个模型的反事实审核应先于临床部署。