论文

大语言模型 中抑郁症的可解释症状向量

Interpretable Symptom Vectors for Depression in a Large Language Model

模型评测模型行为与机制分析

摘要

抑郁症患者表现出不同的症状特征,但临床实践通常将这种变化减少到单一的严重程度评分。 大语言模型 (LLM) 可以从患者言语中捕获各种症状及其严重程度。然而,人们对 LLM 中抑郁症状的表现仍知之甚少,这限制了临床信任。为了检查内部模型激活是否符合临床医生的判断,我们使用机械解释技术分析了 Gemma-3-27B-PT 的残余流。记录从经过验证的临床仪器中提取的症状描述的激活情况,我们发现症状组在多个距离指标的第 21 层几何上分离得最多。然后,我们使用语义投影,将保留的自然文本投影到由这些工具构建的症状向量上。由此产生的每个症状系数保留了临床医生注释的情绪、躯体和自杀轴的排名顺序。此外,第 21 层中的单个抑郁向量将保留的抑郁文本与非抑郁文本分开(AUC = 0.789),这可以用作将症状投射限制为抑郁语音的情绪价门。这些结果揭示了一种不相关的、与临床医生一致的症状信号,可直接从内部激活中读取,为可解释的抑郁症评估工具提供了机制基础。