论文
从临床访谈评估痴呆与抑郁:开放权重LLM的应用
Reading between the Lines: Leveraging Large Language Models for Global Dementia and Depression Assessment from Clinical Interviews
摘要
痴呆和抑郁症是老年人群中最常见的神经精神疾病,它们的重叠症状给鉴别诊断带来了重大挑战。在这项研究中,我们研究了开放权重 大语言模型 (LLM),用于根据对 154 名德语受试者进行标准化病史采集访谈期间收集的语音样本来预测痴呆症和抑郁症的严重程度。我们引入了基于观察者的总体抑郁量表(GDS-D),该量表与已建立的总体衰退量表(GDS)一致,从而能够对情感和认知症状进行并行的总体分期。我们在两种设置中比较了三个 LLM(Mistral 3.1、DeepHermes、Qwen3):(1)零样本预测和(2)基于 LLM 的支持向量回归特征提取,使用人类和包含停顿信息的转录本。结果表明,LLM 在零样本设置中有效预测抑郁症严重程度(最佳 MAE 为 0.60),而痴呆症评估则大大受益于结构化特征提取(最佳 MAE 为 0.78),与零样本基线相比,误差减少高达 35%。包含停顿信息的转录本与人类转录本具有竞争性的表现,证明了用于神经精神鉴别评估的全自动筛选流程的可行性。