论文

通过多属性人类评估检验LLM回答中心理健康支持的质量

Assessing the Quality of Mental Health Support in LLM Responses through Multi-Attribute Human Evaluation

模型评测评测方法与指标

摘要

不断升级的全球心理健康危机以持续的治疗缺口、可及性问题和合格治疗师短缺为标志,使大语言模型(LLM)成为可扩展支持的有前景途径。虽然LLM为可获得的情感援助提供潜力,但其可靠性、治疗相关性以及与人类标准的一致性仍难以保障。本文引入一种以人为基础的评估方法,旨在评估LLM在治疗性对话中生成的回答。我们的方法整理了一个包含500段来自真实场景问题数据集的心理健康对话的数据集,并评估九个多样化LLM生成的回答,包括闭源和开源模型。更具体地,这些回答由两名受过精神科训练的专家独立评估,每项回答按综合6属性量表进行5点李克特评分。该量表涵盖认知支持与情感共鸣,为治疗质量提供多维视角。我们的分析显示,LLM通过生成安全、连贯且临床适当的信息提供了较强的认知可靠性,但其情感对齐不稳定。闭源模型(如GPT-4o)提供较平衡的治疗性回答,而开源模型变异性更大且情感平淡。我们揭示了一个持续存在的认知-情感差距,并强调需要失效感知、临床立足的评估框架,在面向心理健康的LLM中将关系敏感性与信息准确性并重。我们提倡以人在环、围绕治疗敏感性为中心的平衡评估协议,并提供一个框架,以指导面向心理健康的对话式AI的负责任设计和临床监督。

通过多属性人类评估检验LLM回答中心理健康支持的质量
图1:所有 LLM 在平均人类评分(1–5 分制)上的平均属性得分,展示在六个评估维度(Guidance、Informativeness、Safety、Interpretation、Empathy、Helpfulness)上的对比表现