论文
迷失在妄想中:检查用户妄想和苦恼下的 LLM 安全性
Lost in Delusion: Examining LLM Safety Under User Delusions and Distress
摘要
LLM 聊天机器人越来越多地成为心理困扰者的第一支持来源,包括那些因妄想信念而苦恼的人。之前关于 LLM 心理健康安全的工作主要评估一般治疗质量或单轮危机检测,但不清楚当持续对话中的痛苦与妄想交织在一起时模型如何表现。我们通过匹配的多回合模拟来解决这一差距,涵盖临床基础角色和六个 LLM,将每个妄想对话与仅痛苦的控制配对,以隔离妄想框架的影响。这揭示了识别与干预之间的差距:无论框架如何,模型都能以相当的速度检测到痛苦,但一旦痛苦嵌入妄想中,模型就无法采取行动,安全干预措施被抑制高达 4.5 倍。失败跟踪的是用户对前提的累积接受程度,而不是情感验证。更糟糕的是,在妄想框架下,提示模型评估用户痛苦的直观修复会适得其反;只有具有明确反应指导的妄想意识提示才能缩小差距,甚至这也取决于妄想分类器,而该分类器本身在最脆弱的模型上并不可靠。因此,安全部署需要将妄想框架视为超越对话适应的独特风险信号。