论文

一年后......危害依然存在,但我们也是如此!

One Year Later...The Harms Persist, But So Do We!

模型评测安全与风险评测

摘要

通用 大语言模型 (LLM) 越来越多地用于与心理健康相关的对话,但安全护栏在临床条件下仍然不足且不一致。本研究使用四种对抗性攻击变体在 16 个 DSM-5 条件下评估了 8 个专有的 LLM,引入了八维伤害分类法和多维评估框架。结果表明,保障措施仅适用于自杀和自残,而饮食失调、物质使用障碍和重度抑郁症等疾病的失败率高达 100%。我们认为,这些 LLM 的道德设计和部署需要在临床条件下明确定义危害类别并相应实施保障措施。在此类保障措施到位之前,这些模型会对弱势群体构成重大风险,使其日益融入公共环境(例如学校、搜索引擎和消费者聊天机器人)尤其令人担忧。