论文
情境身份测试:区分持久认知身份与角色模仿
The Situated Identity Test: Distinguishing Persistent Cognitive Identity from Persona Imitation
摘要
大型语言模型可以令人信服地采用人物角色,回忆过去的对话,并编织丰富的自传。然而,这种口才掩盖了一个基本的归因问题:看起来像这个角色并不意味着已经过上了这样的生活。两个人可以拥有相同的公众形象——相同的年龄、家乡、职业和性格特征——同时拥有完全不同的私人历史、人际关系和获得的技能。当仅以共享配置文件为条件时,代理缺乏确定哪个谱系是正确的所需信息。我们引入了情境身份测试(SIT),这是一个独立于体系结构的框架,用于评估代理的行为在功能上是否可归因于特定的发展谱系。扎根的身份既需要对记录的经验有适当的了解,又需要对无根的经验有适当的无知,受身份实际获得的内容而不是其底层基础模型所知道的内容的限制。我们证明,任何仅以压缩配置文件为条件的策略都受到谱系歧视查询上 m 个冲突生命历史中最多 1/m 的平均情境有效性的限制(对于配对谱系最多为 50%)。我们在 SITBench 中实例化了这个框架,这是一个评估套件,专为跨 10,000 个计划探针和 9 种架构配置的 25 个轮廓碰撞对(50 个不同的谱系)而设计。在开源参考实现、确定性测试装置和对前沿基础模型(GPT-5.6 Sol 和 Claude Opus 5)的经验试点评估的支持下,我们形式化了轮廓碰撞下角色提示的故障模式,并为评估情景连续性、结构化状态和认知边界提供了保证工具。