论文
生成式AI心理健康支持的风险治理:一种多轮安全架构
Risk Governance for Generative AI Mental Health Support: A Multi-Turn Safety Architecture
摘要
大语言模型(LLM)日益被用于情感支持,却缺乏安全管理不断演变的心理健康风险的机制。现有安全方法主要进行风险检测,却很少塑造模型在会话风险逐步展开时如何回应。我们开发了一种模型无关的安全治理架构,为多轮心理健康交互结合了上下文风险检测、基于推理的验证与协议引导的回复生成。评估采用植根于真实心理健康叙事的合成对话,在GPT-5-chat与Qwen3.5-27B上测试,取得较高的风险检测性能(特异度0.85(95%CI: 0.78;0.91),灵敏度0.92(95%CI: 0.88;0.95)),并在保持融洽与联结的同时将临床医生偏好的升级处置回复比例提升25.6–59.2个百分点。性能在不同对话长度上保持稳定,并在专有与开源模型间均具泛化性。这些发现表明,有临床依据的安全治理可以超越风险检测,改进LLM管理不断演变的心理健康风险的方式,为跨模型的更安全部署提供了可扩展框架。