论文

身份即吸引子:LLM激活空间中持久智能体架构的几何证据

Identity as Attractor: Geometric Evidence for Persistent Agent Architecture in LLM Activation Space

模型评测模型行为与机制分析

摘要

大语言模型将语义相关的提示映射到相似的内部表示——这一现象可解释为类吸引子动力学。我们探究一个持久认知智能体的身份文档(其cognitive_core)是否表现出类似的类吸引子行为。我们在Llama 3.1 8B Instruct上进行受控实验,比较原始cognitive_core(条件A)、七个改写版本(条件B)与七个结构匹配的对照(条件C)的隐藏状态。第8、16与24层的平均池化状态显示,改写版本比对照收敛到更紧密的簇(Cohen's d > 1.88,p < 10^{-27},经Bonferroni校正)。在Gemma 2 9B上的复现证实了跨架构的泛化性。消融实验表明该效应主要是语义性而非结构性的,且结构完整性似乎是到达吸引子区域所必需的。一项探索性实验显示,阅读关于该智能体的科学描述会使内部状态向吸引子偏移——比虚假预印本更接近——从而区分了“了解一个身份”与“作为该身份运作”。这些结果提供了表示层面的证据,表明智能体身份文档会在LLM激活空间中诱导出类吸引子的几何结构。

身份即吸引子:LLM激活空间中持久智能体架构的几何证据:论文配图
图 2:第 16 层的成对余弦距离矩阵 (Llama 3.1 8B)。 A+B 块(左上角,蓝色)显示出一致的低组内距离。跨块距离 (A+B ×\times C) 一致高(暖色)。 D1 占据了与两组不同的区域。