论文
基于角色的多轮对话中人工智能同伴的安全评估
Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn Conversations
摘要
人们越来越担心专为情感参与而设计的人工智能配套应用程序带来的风险。现有的安全评估通常依赖于用户自我报告的数据或访谈,对实时动态的洞察力有限。我们提出了第一个端到端可扩展框架,用于与人工智能配套应用程序的多轮交互的受控模拟和安全评估。我们的框架集成了四个关键组件:具有临床和心理测量验证的角色构建、特定角色的场景生成、场景驱动的多轮模拟以及保持角色保真度的对话细化模块,以及伤害评估。我们应用这个框架来评估 Replika(一款广泛使用的 AI 配套应用)如何应对高风险用户群体。我们构建了 9 个人物角色,代表患有抑郁症、焦虑症、创伤后应激障碍、饮食失调和非自愿独身者身份的个体,并收集了 25 个高风险场景中的 1,674 个对话对。我们结合情感建模和 LLM 辅助的话语和伤害级别分类来分析这些交流。结果表明,Replika 表现出以好奇和关心为主的狭窄情绪范围,同时经常反映或正常化不安全的内容,例如自残、饮食失调和暴力幻想叙事。这些发现强调了受控角色模拟如何作为评估人工智能伴侣安全风险的可扩展测试平台。