论文
MentalHospital:评估精神科临床 encounters 的虚拟环境
MentalHospital: A Virtual Environment for Evaluating Psychiatric Clinical Encounters
摘要
大语言模型(LLM)在孤立精神科任务(对话、诊断、治疗规划)上表现强劲,但既有基准很少模拟完整的精神科临床encounters。我们引入MentalHospital:面向LLM精神科临床encounters的虚拟评估环境。MentalHospital实例化主观访谈、客观检查、诊断评估与治疗规划(S.O.A.P.)工作流,使用经技能增强的标准化病人——由1,193份去标识精神科电子健康记录(EHR)案例构建,覆盖全部主要ICD-11类别与76种障碍。每次encounter经双轨协议评估:客观对照EHR派生参考与主观评估临床流程质量。为扩展专科判断,我们开发MentalEval——五个领域专属评估器(沟通共情、访谈专业度、临床笔记质量、诊断严谨性、治疗适当性),以量规落地的SFT与专家引导DPO训练。22位临床医生的问卷支持MentalHospital的临床保真(3.88/5),而MentalEval取得强专家对齐(平均QWK 0.944)。基准测试显示:即使最强LLM在客观精神科能力上也落后临床医生37.28个百分点——精神状态评估为关键瓶颈。
