论文
LLM 医疗分诊中的隐式地理推断:紧急建议中语言驱动的差异
Implicit Geographic Inference in LLM Medical Triage: Language-Driven Disparities in Emergency Recommendations
摘要
我们调查 大语言模型 是否仅根据患者提示的语言对相同症状产生不同的医疗分诊建议。使用 Gemini 3.5 Flash,我们评估了六种语言(英语、西班牙语、中文、印地语、日语、阿拉伯语)的神经症状特征(持续性头痛、视力模糊、恶心),每种情况运行 30 次(n = 450 次 API 调用总数)。我们发现,该模型建议急诊就诊率从 0%(日语、印地语)到 30%(英语、阿拉伯语)不等,尽管所有语言的严重程度分数几乎相同 (7.7-8.0/10)。添加指定患者美国位置的单个句子可将非英语提示的 ER 建议提高高达 76.7 个百分点,而反向锚点(带有东京位置的英语提示)可将 ER 率从 30% 降低至 6.7%。反向翻译控制(日语到英语)产生与英语基线相当的 ER 率,确认差异不是由翻译质量引起的,而是由输入语言的隐式地理推断引起的。我们发布了完整的数据集、实验代码和结果。