论文

当词汇理解无法进行临床推理时:评估阿尔法一代治疗机器人的安全风险

When Vocabulary Comprehension Fails Clinical Reasoning: Evaluating Therapy Bots' Safety Risks for Generation Alpha

模型评测安全与风险评测

摘要

对话式人工智能系统已成为阿尔法一代(Gen Alpha,出生于 2010-2024 年)的非正式心理健康支持资源,13.1% 的美国青少年(540 万)使用生成式人工智能提供心理健康建议。虽然这些系统(从治疗应用程序到一般聊天机器人)都依赖于经过大量心理学文献训练的 大语言模型,但它们对以夸张语言、讽刺积极性、快速语义漂移和上下文多义为特征的青少年交流模式的安全性仍未得到验证。在发生多起与人工智能聊天机器人交互相关的青少年死亡事件后,系统评估至关重要。我们提出两个基准:(1) 由母语人士 (ICC=0.72) 和临床医生 (kappa=0.78) 验证的 64 Gen Alpha 心理健康表达; (2) 75 次多回合对话(780 回合),配有配对的标准/Gen Alpha 版本。在对 LLM 架构底层治疗应用程序和一般聊天机器人(Claude、GPT-4o、Llama-3.1)的评估中,模型理解 76-82% 的词汇,但只能正确校准 64-72% 的临床风险,造成人类治疗师不存在的 10-14 个百分点 (pp) 词汇理解差距 (p<.001,d>0.48) (3pp, p=.22)。差距在架构上是一致的,并且随着模糊性而扩大(7pp -> 18pp)。我们确定了六种失败模式:讽刺掩饰(29pp)、最小化接受(43pp)、非正式风格偏见(24pp)、风险分层模糊(19pp)、语义漂移(19pp)、上下文相关暴力(7pp)。图案复合;三个或以上产量达 94% 的失误率。轻量级缓解措施失败;只有重型脚手架才能达到人类性能(成本的 6.4 倍)。 34% 的基线遗漏率导致每年估计遗漏 146,880 起危机,我们建议采用强制性的人机循环架构、针对青少年的季度验证、透明的绩效披露以及面向青少年的心理健康人工智能的监管框架。