论文

心理健康对话中的专家级危机检测

Expert-Level Crisis Detection in Mental Health Conversations

模型评测基准与评测资源

摘要

现实世界的危机干预本质上是对话性的,但现有的研究主要集中在静态文本上。当应用于多轮对话时,当前模型表现出显着的性能下降,难以跟踪随着上下文演变而出现的风险信号。为了解决这一差距,我们引入了 CRADLE-Dialogue,这是一种由临床医生注释的基准,用于对话环境中的轮次危机检测。该数据集包含 600 个带有多标签注释的对话,涉及临床风险,包括自杀意念、自残和虐待儿童,区分过去的风险和当前的风险。我们进一步提出了一种警报-确认评估方案,该方案将早期预警信号(警报)与特定危机变得明确可识别的转折点(确认)区分开来,反映了在风险变得明确之前进行干预的临床需要。实验表明,识别风险何时出现比识别风险的存在要困难得多:模型仅达到 40% 到 60% 左右的 Micro F1。此外,我们还发布了一个综合训练语料库和一个 32B 参数模型,其性能大大优于现有的开源模型,并在轮次级别、对话级别和仅确认评估设置方面与专有模型相比取得了有竞争力或更好的结果。