论文
智能体记忆内部发生了什么:从涌现到诊断的回路分析
What Happens Inside Agent Memory? Circuit Analysis from Emergence to Diagnosis
摘要
代理内存故障是无声的:基于 LLM 的代理即使无法提取、保留或检索跨会话所需的信息,也可以产生流畅的响应。写-管理-读循环描述了这些系统的外部管道,但没有考虑实现每个阶段的内部计算。通过追踪 Qwen-3 系列 (0.6B--14B) 和两个内存框架(mem0 和 A-MEM)的内部特征电路,我们报告了三个发现。首先,控制先于内容被检测到:路由电路在 0.6B 处因果活动,而内容电路在我们的跟踪设置下直到 4B 才产生可检测到的信号,从而创建了一种部署机制,其中小模型具有明显的能力进行路由,但在提取和接地时默默地失败。其次,在内容组内,写入和读取共享一个后期层集线器,该集线器作为已存在于基本模型中的上下文基础基底运行;只有记忆框架在该基底上招募功能性接地方向,并且中枢在两个框架之间传输。第三,出现并不意味着可操纵性:虽然内容电路在 4B 时变得可检测,但只有在 8B 时才变得可靠可操纵,这表明检测和干预具有不同的规模阈值。作为实际意义,两个电路组之间的特征空间分离使得每次操作故障定位的准确度达到 76.2%,无需监督,从而为其他静默代理内存故障提供阶段级诊断。
