论文

CBT-Audio:评估音频语言模型在CBT会谈录音中的患者侧痛苦强度估计

CBT-Audio: Evaluating Audio Language Models for Patient-Side Distress Intensity Estimation in CBT Session Recordings

模型评测基准与评测资源

摘要

认知行为疗法被广泛用于帮助患者理解和管理心理痛苦。它通常通过口语对话进行,治疗师不仅关注患者说了什么,还关注他们怎么说,因为这些线索有助于治疗师决定如何回应和调整治疗。为CBT构建AI系统的进展大多局限于文本,部分原因是大多数可用数据集基于文本,而在伦理和隐私约束下可共享的口语CBT数据稀缺。这造成了一个盲区,因为基于文本的模型和评估无法捕捉转录文本与患者语音之间的不一致,尽管治疗师常依赖这种不一致来理解患者痛苦。我们提出CBT-Audio,一个用于评估音频语言模型从口语CBT会谈中估计患者痛苦的数据集。CBT-Audio包含来自96段公开CBT录音的1802个患者话轮,话轮级痛苦标签在专家标注子集上得到验证。我们在三种输入条件下评估10个开源音频语言模型:模型仅接收患者音频、仅接收转录文本,或同时接收音频与转录文本。结果表明,音频能提供文本之外的有用信息,尤其是与转录文本结合时。在10个模型家族中的8个里,转录输入加入音频比仅用转录提升了痛苦估计,其中4个提升显著;案例研究显示,当言语内容与语音表达方式不一致时收益最明显。CBT-Audio使口语患者行为在CBT相关任务的AI评估中变得可测量,并支持面向心理健康交互的音频语言模型的后续研究。

CBT-Audio:评估音频语言模型在CBT会谈录音中的患者侧痛苦强度估计:论文配图
图 1:从公开的 CBT 会话到模型评估的流程:(1) 使用说话者二值化提取患者轮流,(2) 通过专家验证进行基于 GPT 音频的痛苦强度标记,(3) 跨三种输入条件评估 10 个 ALM。