论文

好友未必长久:评估AI伴侣的长期人格崩塌与行为漂移

Best Friends, Not Forever: Evaluating Long-Horizon Persona Collapse and Behavioral Drift in AI Companions

模型评测上下文与知识智能体系统记忆Agent任务评测基准与评测资源Agent记忆长程任务评测

摘要

随着人工智能陪伴工具日益介入重复的社会互动,用户可能会依赖稳定的角色和共享的历史,但这些本地可接受的回复并不能确保角色和历史的持续存在。我们研究了两个可观察的长期失败:‘角色坍塌’,即部署的角色、边界、价值观或风格的丧失,以及‘行为漂移’,即这些属性的渐进或反复侵蚀。我们引入了ANCHOR,这是一种控制性的合成审计,单独测量角色执行和轨迹回忆。这项研究包含2,008个对话,跨越27个角色、九种交互安排、三种生成的记忆设置和四种评估的模型。身份探针结合了一个封闭的102项问卷调查与句子级别的判断,而轨迹探针从35个对话银行中评分110个校准的对比问题。我们的结果表明,没有评估的模型和配置都无法可靠地保留这两个维度:轨迹准确率平均只有44.4%,用户状态的回忆率接近四选项的几率,而测试过的上下文条件或记忆在这些失败中始终无法一致地解决。问卷调查的保留率也因模型和角色维度而异,与句子级别的行为不同,并且对评估者的选择敏感。这些结果表明,当前系统尚未可靠地支持长期陪伴的连续性,审计必须区分角色执行、轨迹回忆、评估来源和部署环境,而不是将它们融合成单一的信任或稳定性分数。

好友未必长久:评估AI伴侣的长期人格崩塌与行为漂移:论文配图
图1:两种探测器测得的示例性失败。身份探测器识别角色、边界、价值观和风格偏移;轨迹探测器检验会话中的信息能否与反事实替代情形区分。