真值 第一:智能体内存纵向评估工具,以及内存架构排名中的任期交叉
Ground Truth First: A Longitudinal Evaluation Instrument for Agent Memory, and the Tenure Crossover in Memory-Architecture Rankings
摘要
LLM 代理内存的基准通常首先生成对话,然后提取答案键(记录标签错误和污染问题),并且它们绝大多数测量短交互历史记录。我们反转管道:种子生命脚本采样器在任何文本存在之前发出带有有效性间隔、波动性类别和源通道的事实; LLM 渲染器根据每个事件的事实清单写入聊天和电子邮件;保真度验证者确认每一个植入的事实;问题是从脚本中机械实例化的,因此标准答案在构造上是脚本有效的,并单独验证可回答性。合成的、虚构的语料库(约 380 个问题,15 种类型)嵌入了我们调查的基准中缺少的功能:事实有效性区间、发送/接收的信任区别、良性工具中的注入探针以及最新的问题集。将五种内存架构与无内存控制(固定应答器、版本化 LLM 判断、三个重复、两个水平线)进行基准测试,我们发现后端排名随着历史长度的变化而反转:在三周内领先的预算策划地图内存对被驱逐内容的回忆能力下降了九周(96% 到 72%),而出处类型的图表则上升到 90%;在完全跨家庭重新判断下,所有六名用户的倒转均为正(精确 p=0.031)。完整渲染历史基线在短期内追平或超过了最好的内存系统,但在九周后没有显示出独立于判断的优势,读取成本约为读取成本的两倍。写入阶段质量与下游质量密切相关(弱写入事实失败率为 24% vs 2%),并且注入阻力跟踪出处边界是否能够幸免于表示。分层架构在两种机制的内存系统中表现最佳(96.8% 短视野),并以 Veracium 的形式发布,这是一个开源库,带有语料库生成器和工具。