论文

Glow 的初步风险探测与可行性测试:一个面向物质使用康复与 HIV 预防的生成式 AI 驱动辩证行为疗法技能教练

Initial Risk Probing and Feasibility Testing of Glow: a Generative AI-Powered Dialectical Behavior Therapy Skills Coach for Substance Use Recovery and HIV Prevention

模型评测安全与风险评测

摘要

背景:HIV 与物质使用是相互作用的流行病,具有共同的心理驱动因素——冲动性与适应不良的应对方式。辩证行为疗法(Dialectical behavior therapy,DBT)针对这些机制,但面临可扩展性挑战。生成式人工智能(GenAI)为大规模提供个性化 DBT 辅导提供了潜力,但快速发展已使安全基础设施建设滞后。方法:我们开发了 Glow,一个由 GenAI 驱动的 DBT 技能教练,为面临 HIV 与物质使用风险的个体提供链分析和解决方案分析。我们与洛杉矶一家社区卫生组织合作,对临床工作人员(n=6)和有亲身经历者(n=28)开展了可用性测试。我们采用有益、诚实且无害(Helpful, Honest, and Harmless,HHH)框架,实施由用户驱动的对抗性测试,由参与者识别目标行为并生成符合真实情境的风险探测。我们在 37 次风险探测交互中评估了安全表现。结果:Glow 恰当处理了 73% 的风险探测,但表现因智能体而异。解决方案分析智能体达到 90% 的恰当处理率,而链分析智能体仅为 44%。安全失败集中在鼓励物质使用和使有害行为正常化上。链分析智能体落入“共情陷阱”,其提供的肯定反而强化了适应不良的信念。此外,还发现 27 例 DBT 技能误传。结论:本研究首次对 GenAI 提供的 DBT 辅导在降低 HIV 与物质使用风险方面开展系统性安全评估。研究结果揭示了在进入临床试验前需要缓解的脆弱点。HHH 框架与用户驱动的对抗性测试为评估 GenAI 心理健康干预提供了可复现的方法。