D²ACCI:面向证据保全型智能体记忆的双循环诊断协议
D$^2$ACCI: A Dual-Loop Diagnostic Protocol for Evidence-Preserving Agent Memory
摘要
记忆是 LLM 智能体的关键能力。持久化记忆把这一能力扩展到会话之外——实现回忆、修订与个性化。然而其多阶段流水线(摄取、检索、过滤、生成)使故障难以定位:端到端评估只能揭示发生了错误,却无法指出哪个阶段造成。现有评估往往只报告聚合性能,缺少配对统计比较、切片级不回退检查或阶段级诊断轨迹。我们提出 D²ACCI(Diagnostic-Driven Artifact-based Closed-loop Controlled Iteration),一个双循环协议,其外层诊断门控基于配对证据、受保护切片监控与轨迹级可定位性来提升、特性开关或拒绝记忆干预。我们进一步引入 DCR——一个衡量故障是否保持可定位的分级可观测性指标,以及 D²ACCI-Eval——一个可复用于门控回放的产物。我们在 MemStack 中实例化该协议,并在三个公开基准上评估:LoCoMo 上达 93.59%,LongMemEval 上达 90.93%,PersonaMem-V2 上达 57.20%。五项配对消融显示,补充信息抽取、会话记忆检索与 Forget Guard 带来统计显著增益(+1.9 至 +3.7 个百分点,均 p ≤ .003)。相比之下,BM25/RRF 被保留为受监控的特性开关——这一区别在仅看聚合指标的评估中不可见。诊断审计显示,富化轨迹相比仅按结果重标注大幅提高根因一致性。诊断产物达到 98–100% 的 DCR@3,而仅含结果的日志为 0%。这些结果确立:稳健的记忆系统迭代需要可追溯、有统计依据且关注回退的证据——这正是 D²ACCI 填补的空白。
