论文
衡量重要的事情!!评估心理健康对话中的治疗原则
Measuring What Matters!! Assessing Therapeutic Principles in Mental-Health Conversation
摘要
大语言模型 在心理健康应用中的使用越来越多,需要有原则的评估框架,以评估与超越表面流畅性的心理治疗最佳实践的一致性。虽然最近的系统表现出对话能力,但它们缺乏评估对核心治疗原则的遵守情况的结构化机制。在本文中,我们研究了评估人工智能生成的治疗师式反应的临床基础适当性和有效性的问题。我们按照六项治疗原则评估每位治疗师的言论:不带评判的接受、温暖、尊重自主、积极倾听、反思性理解以及使用细粒度序数表的情境适当性。我们引入了 FAITH-M(一种由专家分配的序数评级注释的基准),并提出了 CARE(一种多阶段评估框架),该框架集成了对话内上下文、对比示例检索和知识蒸馏的思想链推理。实验表明,CARE 的 F-1 分数为 63.34,而强基线 Qwen3 F-1 分数为 38.56,提高了 64.26,这也是其骨干能力,这表明收益来自结构化推理和上下文建模,而不仅仅是骨干能力。专家评估和外部数据集评估进一步证明了领域转移下的稳健性,同时强调了建模隐性临床细微差别的挑战。总体而言,CARE 提供了一个基于临床的框架,用于评估人工智能心理健康系统的治疗保真度。