论文
LingxiDiagBench:用于评测LLM中文精神科问诊与诊断的多智能体框架
LingxiDiagBench: A Multi-Agent Framework for Benchmarking LLMs in Chinese Psychiatric Consultation and Diagnosis
摘要
精神障碍在全球高度流行,但精神科医生短缺以及基于访谈的诊断固有的主观性,为及时且一致的心理健康评估造成了重大障碍。AI辅助精神科诊断的进展受制于缺乏能同时提供真实患者模拟、经临床医生核验的诊断标签以及动态多轮问诊支持的基准。我们提出LingxiDiagBench,这是一个大规模多智能体基准,评估LLM在中文静态诊断推理与动态多轮精神科问诊两方面的表现。其核心是LingxiDiag-16K,一个包含16,000条与电子病历(EMR)对齐的合成问诊对话的数据集,旨在再现覆盖12个ICD-10精神科类别的真实临床人口学与诊断分布。通过在先进LLM上的大量实验,我们确立了关键发现:(1) 尽管LLM在抑郁-焦虑二分类上达到高准确率(最高92.3%),但在抑郁-焦虑共病识别(43.0%)和12类鉴别诊断(28.5%)上性能大幅下降;(2) 动态问诊常常逊于静态评估,表明低效的信息采集策略会显著损害下游诊断推理;(3) 由LLM-as-a-Judge评估的问诊质量与诊断准确率仅呈中等相关,表明仅凭结构良好的提问并不能保证正确的诊断决策。我们在 https://github.com/Lingxi-mental-health/LingxiDiagBench 发布LingxiDiag-16K与完整评估框架,以支持可复现研究。
