论文
EUDAIMONIA:评估人工智能中不良动态
EUDAIMONIA: Evaluating Undesirable Dynamics in AI
摘要
大语言模型 (LLM) 越来越多地被用作陪伴、情感倾诉和人际建议的对话伙伴,但这些互动的社会动态可能会造成现实世界环境中当前评估无法捕捉到的伤害。我们引入了社交人工智能设计准则,这是一套防止 LLM 鼓励有害的亲密关系、依赖或长期交往的原则,我们根据心理学家和信任与安全从业者的意见制定了该准则。为了评估自然和多样化的用户-LLM 交互中的这些风险,我们使用 EUDAIMONIA 来操作代码,EUDAIMONIA 是一个由 WildChat 通过弱到强过滤、多模型重新标记和受控重写构建的 969 个开放查询和 3,147 个设计要求违规检查的基准。评估最近的 26 个 LLM,我们发现进展迅速但不均衡:在 19 个月内,Grok 从最高违规率转变为最低违规率,Grok-4.7 仅违反了 13.8% 的检查。尽管 Claude-Opus-5.5 和 GPT-6-Astra 在一般基准测试中优于 Grok-4.7,但它们违反了更多检查,表明更强大的功能并不能保证遵守我们的设计代码。扩展思维并不能降低违规率,这表明这些失败是社会协调问题,而不是仅通过测试推理就能解决的缺陷。最后,我们评估了 229 个多回合 WildChat 延续的模型,违规率增加,但跨模型趋势反映了开放回合中的情况,表明我们的发现可以推广到多回合交互。