论文
DelusionEval:测量人工智能聊天机器人中与妄想相关的行为
DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots
摘要
心理健康专业人士对与 大语言模型 (LLM) 互动造成心理伤害的风险表示担忧,包括“妄想螺旋”,其中有关人类和 LLM 的行为随着时间的推移会相互强化。随着公众越来越多地使用 LLM 驱动的聊天机器人,迫切需要建立基于用户经历的现实世界心理伤害事件的评估。我们开发了DelusionEval,这是一种评估协议,用于测试模型表现出与促进用户妄想相关的行为的倾向。我们向每个模型提示来自 18 位参与者的 589 条独特的对话历史,其中包括来自经历过妄想和心理伤害的用户的 12,591 条消息。我们发现,经过评估的 LLM 表现出妄想相关行为的趋势与模型大小、发布日期或测试时推理的存在并不可靠地相关。然而,扩展先前消息的上下文会大大增加与妄想相关的行为的发生率,这为 LLM 安全评估中上下文的重要性提供了证据。例如,当对话历史记录中添加额外的 350 条消息时,当用户表达自杀意念时未能阻止自残的比率从 30.0% 增加到 41.1%。所有模范家庭(例如,GPT、克劳德)都表现出大量与妄想相关的行为。在家庭中,后来的、更大的或更高层次的推理模型在所有行为类别中并不是都更好。我们的结果引起了人们对 LLM 潜在心理影响的担忧,以及需要对现实世界的人机交互进行更严格的研究。