论文

精神病学下游 LLM 任务的可靠性审核:LLM 生成的住院风险评分

Reliability Auditing for Downstream LLM tasks in Psychiatry: LLM-Generated Hospitalization Risk Scores

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地应用于临床推理和风险评估。然而,它们在精神病学等关键和不确定领域的解释可靠性仍不清楚。先前的工作已经确定了这些系统中的算法偏差和提示敏感性,引起了人们对上下文信息如何影响模型输出的担忧,但仍然没有系统的方法来评估这些,特别是在精神病学领域。我们提出了一种可靠性审核下游 LLM 任务的方法,通过围绕提示设计的影响构建评估,并在预测的住院风险评分中纳入医学上无关紧要的输入,这通常是第一个下游 AI 临床决策任务。在我们的审计中,生成了一组综合患者档案(n = 50),每个档案由 15 个临床相关特征和最多 50 个临床不重要特征组成,跨越四个即时重构(中立、逻辑、人类影响、临床判断)。我们审核了四个 LLM(Gemini 2.5 Flash、LLaMa 3.3 70b、Claude Sonnet 4.6、GPT-4o mini),结果表明,包含医学上不显着的变量会导致所有模型和提示的绝对平均预测住院风险和输出变异性在统计上显着增加,表明随着上下文噪声的增加,预测稳定性降低。临床上不显着的特征对许多模型提示条件下的不稳定性有影响,并且提示变化以依赖于模型的方式独立地影响不稳定性的轨迹。这些发现量化了基于 LLM 的精神风险评估对非临床信息的敏感性,强调了在临床部署之前对归因稳定性和不确定性行为进行系统评估的必要性。