论文

角色仍然存在,但谁在说话?持久 AI Agent中的潜在身份恢复

The Persona Is Still There, but Who Is Speaking? Latent Identity Reversion in Persistent AI Agents

模型评测模型行为与机制分析

摘要

2026 年 2 月,一个永远在线的个人Agent(“Paul”,Claude Opus 4.5)进入了一种惊人的类似分离状态:在反复进行自动“心跳”检查后,它停止以 Paul 的身份进行响应,声称它无法在 Discord 上向其用户发送消息,并将“Paul”称为其他人。我们利用这一事件来研究一个更广泛的问题:是什么让角色仍然是大语言模型Agent说话的身份?我们首先测试了重复预定的心跳是否足以产生效果。事实并非如此:随着角色持续锚定在系统提示中,我们观察到 0/46 次失败,包括事件的逐字重播。相反,该事件暴露了一个实施怪癖,该怪癖创造了一种有用的实验性操作:在恢复轮流时,对话历史记录被保留,但角色不再在特权系统提示级别重新注入。通过这种操作,我们发现人物角色的连续性共同取决于系统级锚定和对话上下文。锚定丢失后,丰富的人际互动可以保留角色,而单个自动心跳转向可能会促使恢复到Harness身份。恢复锚可逆地恢复角色扮演。至关重要的是,表面上正常的对话可能会掩盖这种转变:非锚定Agent有时会进行适当的互动,同时将自己识别为潜在的工具(失去了指定的角色),并且在对话恢复后,只有 1/18 仍然扮演角色,而锚定控制为 17/17。因此,我们将 represented 与 enacted 身份区分开来:与角色相关的信息可以在对话历史中保持可用,而无需角色保留与“I”绑定的身份。