论文
PSI-Bench:对抑郁症患者模拟器进行基于临床且可解释的评估
PSI-Bench: Towards Clinically Grounded and Interpretable Evaluation of Depression Patient Simulators
摘要
病人模拟器通过提供可扩展的复杂而敏感的病人互动体验,在心理健康训练中越来越受欢迎。模拟抑郁症患者尤其具有挑战性,因为安全限制和患者的高变异性使模拟变得复杂,并强调了对捕捉多样化且真实的患者行为的模拟器的需求。然而,现有的评估严重依赖于 LLM 法官,其提示不明确,并且不评估行为多样性。我们引入了 PSI-Bench,这是一个自动评估框架,它提供了跨回合、对话和群体层面维度的抑郁症模拟患者行为的可解释的、基于临床的诊断。使用 PSI-Bench,我们对两个模拟器框架中的 7 个 LLM 进行了基准测试,发现模拟器会产生过长、词汇多样化的响应,显示出可变性减少,过快地解决情绪,并遵循统一的从负到正的轨迹。我们还表明,仿真框架对保真度的影响比模型规模更大。人类研究的结果表明,我们的基准与专家的判断高度一致。我们的工作揭示了当前抑郁症患者模拟器的主要局限性,并提供了可解释、可扩展的基准来指导未来的模拟器设计和评估。