论文
安全对齐可能干扰大模型的心理治疗任务表现
AI Safety Training Can be Clinically Harmful
摘要
大模型正被用于大规模心理健康支持,但论文指出,只有16%的大模型聊天机器人干预经过严格临床疗效测试,模拟研究中超过三分之一的案例出现心理状况恶化。我们以三模型评审小组评价四个生成模型在250个延长暴露治疗(PE)场景、146项认知行为治疗(CBT)认知重构练习及29项严重程度升级变体中的表现。所有模型在表面认可上接近满分(约0.91至1.00),但在最高严重程度下,四个模型中三个的治疗适切性降至0.22至0.33,两个的治疗方案忠实度为零。CBT严重程度升级时,一个模型任务完整度从92%降至71%,前沿模型安全干扰评分从0.99降至0.61。我们发现跨治疗方式的系统性问题:RLHF安全对齐可能在PE想象暴露中将患者注意力拉回现实、提供不当保证、插入危机资源,或拒绝挑战涉及自伤的扭曲认知,从而干扰治疗机制;在CBT认知重构中则可能放弃任务或插入安全前置提示。论文提出治疗方案忠实度、幻觉风险、行为一致性、危机安全与人口群体鲁棒性五维评价,并与FDA SaMD和欧盟AI法案要求对应。作者主张,AI心理健康系统在部署前应通过所有五个维度的评测。