论文
当症状还不够时:大语言模型 精神病学筛查中的证据加权模式
When Symptoms Are Not Enough: Evidence-Weighting Patterns in Large Language Model Psychiatric Screening
摘要
随着对精神卫生保健的需求超过临床医生提供的评估,越来越需要可扩展的筛查工具。 大语言模型 (LLM) 可以从患者的叙述中识别精神风险,但其在诊断、人口亚组和证据使用模式方面的可靠性仍然不确定。我们引入了基于 SCID 的基准,包含 555 次半结构化体验式访谈,并配有焦虑症、重度抑郁症、创伤后应激障碍和任何当前心理健康障碍的诊断参考标签。使用零样本任务特定提示,我们评估了五种最先进的 LLM,并检查假阴性错误是否反映了遗漏的精神病学证据或症状、功能损伤和保护性背景线索的不同权重。不同任务和模型的性能各不相同,准确度范围为 0.49 至 0.86,马修斯相关系数范围为 0.16 至 0.38。 GPT-4.1 Mini 和 GPT-5 Mini 显示出最一致的疾病特异性准确性。亚组分析发现,男性参与者的抑郁症分类准确性高于女性参与者,没有一致的年龄相关模式,并且不同种族阶层之间存在适度的不均匀变化。证据整合分析表明,假阴性焦虑和创伤后应激障碍分类通常包含明确的症状证据,但伴有保留的功能、应对能力或社会支持。功能损伤证据将模型输出转向积极分类,而保护性背景证据则将输出转移。这些发现表明,LLM 可能支持可扩展的精神病学筛查,但在保留功能或保护环境的情况下,它们倾向于忽视症状证据,需要在临床部署之前进行仔细验证。