论文

LLM 在 CBT 引导的情感推理中有何不足?

Where do LLMs Fall Short in CBT-Guided Affective Reasoning?

模型评测模型行为与机制分析

摘要

认知行为疗法(CBT)提供了一个结构化框架,通过检查认知和行为因素之间的相互作用来理解用户的心理状态。然而,开箱即用的 LLM 可以流畅且富有同理心地响应,但无论用户实际需要什么,都会陷入验证和反思。他们了解理论上的 CBT(在许可考试问题上得分高达 96% 的准确率),但未能有效地应用它。我们通过知识引导框架来探索这一差距,该框架将 CBT 对话视为受控情感推理:用户叙述被分解为 Beck 的认知概念化结构,该结构基于通过自然语言推理验证的临床 SNOMED CT 概念,以及验证与反思、苏格拉底式提问或替代视角之间的多重思维链 (MCoT) 策略选择。为了衡量这种指导是否真正改变了行为,我们引入了协议杠杆力(F),这是一种行为级别的指标,用于捕获干预措施使模型偏离其默认响应的程度。在三个开放权重 LLM 和 14 个由 RealCBT 衍生的案例研究中,由人类专家、价唤醒轨迹和语言夹带进行评估,F 表明,通过单一思维链提示简单地引入协议定义无法改变 LLM 行为,而这些定义上的 MCoT 可以更好地指导策略选择。尽管如此,效果仍保持在 1% 以内(约 1.2-1.3%),并且所有模型仍然偏向于验证和反思。这些结果表明,仅靠 CBT 知识并不能确保有效的应用,从而为情感计算社区提供了工具来衡量 LLM 的不足之处。