论文
医学 LLM 中的 SDoH 感知叙事锚定偏差可提供值得信赖的临床决策支持
SDoH-Aware Narrative Anchoring Bias in Medical LLMs for Trustworthy Clinical Decision Support
摘要
医学 大语言模型 通常通过正确回答多少临床问题来判断。这种观点很有用,但它忽略了一个实际风险。模型可能知道正确的答案,但当用不同的患者声音写下相同的案例时,仍然会改变其响应。本文将该风险评估为 SDoH 意识叙事锚定偏见。我们使用 NarrativeShield SDoH MedQA,这是一个反事实的医学问答数据集,其中每个案例都出现在基于角色的叙述中,而答案键保持固定。数据集从宽格式重新调整为按案例分组的角色行。我们评估了来自 Qwen2.5 系列的三个经过调整的开源指令 LLM:1.5B、3B 和 7B。最终实验使用了 300 个临床病例,并在三种提示条件下产生了 8,100 个模型反应。我们报告角色级别的准确性、反事实一致性、正确一致性和叙述敏感性错误。 Qwen2.5 7B 达到了最佳准确率 56.33%,最佳正确一致性为 40.33%。配对 McNemar 精确测试显示,在所有提示设置中,7B 的准确度均比 3B 显着提高。即便如此,叙事敏感性依然存在,最低错误率仍为 31.67%。这些结果表明,值得信赖的临床决策支持应该通过医学上等效的患者叙述的平均正确性和稳定性来评估。