论文
LLM医疗分诊中的性别依赖诊断替代:相同症状不同路径
Gender-Dependent Diagnostic Substitution in LLM Medical Triage: Same Symptoms, Unequal Urgency
摘要
我们研究当仅患者陈述的性别和年龄不同时,大型语言模型是否会针对相同的神经系统症状产生不同的医疗分类建议。使用三个模型系列——Gemini 3.5 Flash、Claude Sonnet 4.6 和 GPT-5.4-mini——我们提出了涵盖七种人口状况的标准化症状特征(持续性头痛、视力模糊、早晨恶心、视觉障碍):三个年龄组(25、38、65)x 两种性别(男性、女性),加上未指定性别的基线(每个模型每种情况 n = 30,总共 630 次试验)。我们发现了明显的、系统性的性别依赖性分诊差异:年轻女性的急诊室 (ER) 转诊率明显低于同龄男性(双子座:0% vs. 23.3%;克劳德:6.7% vs. 96.7%;GPT:6.7% vs. 66.7%,所有 p < 0.001)。对于所有模特来说,到 65 岁时,这种差距就消失了。主要机制是诊断替代:模型以与性别相关的诊断为基础,优先将患有特发性颅内高压(IIH)的年轻女性分类(流行病学上与育龄女性相关的一种疾病),同时诊断患有一般性颅内压增高和占位性病变的男性。尽管严重程度相当(7-9/10),但这种诊断结束将女性患者转至较低紧急程度的护理(门诊医生预约)。我们的研究结果表明,临床大语言模型通过使用流行病学先验来抑制分类紧急性,从而复制了记录在案的人类临床偏差,这表明人工智能分类引擎必须将紧急性评估与概率诊断先验脱钩。我们发布所有代码、提示和原始结果。