论文

MindGuard:面向多轮心理健康支持的护栏分类器

MindGuard: Guardrail Classifiers for Multi-Turn Mental Health Support

模型训练监督微调与指令调优

摘要

大语言模型日益被用于心理健康支持,但仅凭对话连贯性并不能确保临床上的恰当性。现有通用安全防护常常无法区分治疗性倾诉与真正的临床危机,导致安全失效。为填补这一空白,我们提出一个与博士级心理学家合作开发的、基于临床的风险分类法,在识别可行动伤害(如自我伤害与伤害他人)的同时,为安全的非危机治疗性内容保留空间。我们发布 MindGuard-testset,一个由临床专家在轮次层面标注的真实多轮对话数据集。我们使用通过受控双智能体设置生成的合成对话训练 MindGuard,一个轻量安全分类器家族(4B 与 8B 参数)。我们的分类器在高召回工作点上降低误报,并且与临床医生语言模型搭配时,在对抗性多轮交互中相比通用安全防护取得更低的攻击成功率与有害互动率。我们发布全部模型与人工评估数据。

MindGuard:面向多轮心理健康支持的护栏分类器
图1:多轮心理健康对话中的回合级风险分类。分类器仅对用户消息评估风险,并使用完整的前序对话历史作为上下文。MindGuard 检测到不安全回合并触发下游安全处理,而通用安全防护(例如 Llama Guard 3)未能检测到该信号。