论文

诊断前询问:Safe-Psych,精神病学 LLM 的序贯评估基准

Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于医疗保健领域的决策支持,但临床证据通常不完整或不断变化。当现有信息不足以支持可靠的答案时,模型应要求澄清或弃权,而不是提供不受支持的答案。然而,现有的医疗基准通常假设预先可以获得完整的信息。我们推出 Safe-Psych,这是一个连续基准,用于评估 LLM 如何处理临床精神病学中不断变化的诊断不确定性。 Safe-Psych 包含 1,000 多个真实世界的精神病学临床记录,这些记录被分段以模拟增量证据披露,每个阶段都有精神病学家衍生的操作标签:诊断、澄清或戒律。我们在完整信息和顺序设置中评估多个最先进的 LLM。我们的研究结果表明,能力并不能确保校准:即使是强大的模型也会在不完整的临床信息下陷入困境,大多数模型的弃权率不足超过 60%,并且安全意识促使只有通过将错误转向过度弃权来减少过早的承诺。在序贯评估中,模型经常在获得足够证据之前进行诊断,除非明确提示,否则很少寻求澄清;这些过早的诊断不如及时的诊断准确。总体而言,Safe-Psych 揭示了评估模型的局限性:识别临床证据何时不完整且需要额外信息。我们发布 Safe-Psych 来支持改善 LLM 医疗保健安全性的研究。