论文

记忆更新而行为未变:修复个性化Agent响应中的隐式过期依赖

When Memory Updates but Behavior Does Not: Repairing Implicit Stale Dependencies in Personalized Agent Responses

上下文与知识记忆Agent记忆

摘要

记忆增强代理知道用户存储状态过时,仍然计划绕过旧值。STALE基准将此称为隐性策略适应(IPA)差距。我们识别一个结构上的贡献者:验证检查响应,而在开放性响应中,通常没有提及旧依赖。StateAuditor因此审计从存储状态到草稿的方向。一个LLM提出从时间戳证据中候选旧到新转换;确定性代码将每个引文绑定到单个条目,检查新证据是否确实更新,并允许只有这些经过验证的转换触发修复。被验证的是来源和时间顺序,而不是语义替换。在STALE的完整协议(400个场景,50个会话历史,每个查询独立响应)中,严格单个查询VTA分数为0.736,而我们的锁定前驱器在相同的法官下为0.686:+5.0点配对收益(95%置信区间:+2.9,+7.2)。来自STALE基准的自身法官,来自第三个模型家族,再现了收益(0.738 vs. 0.680)。在独立跨模型偏好进化基准(HorizonBench)上,完整的草稿审计修复管道在金库衍生的结构存储上提高了当前偏好准确率(用户聚类p<0.01),尽管匹配控制显示大部分外部收益来自草稿审计本身;一个更难的作者生命周期集没有收益,限制了声称,但虚假无效化保持控制。相比之下,在STALE上,匹配控制(相同证据、适配器和调用预算)仅得分为0.692(+0.6超过前驱器,n.s.),将STALE收益归因于转换机制而非附加上下文或调用。我们对一般用途代理记忆没有做出一般性声明。

记忆更新而行为未变:修复个性化Agent响应中的隐式过期依赖:论文配图
图2:StateAuditor 的实例:用户已从西雅图搬到奥斯汀,但周末活动草稿仍依赖西雅图。以草稿为锚的检查裁定草稿陈述或预设的前提;以状态为锚的检查将草稿内容与各项已变化属性的当前值对照。合并裁决驱动按类型再生成:修复、纠正并告知,或先回答再询问确认。修复必须由核实来源及时间顺序的状态转换(§4.4)授权,否则基础裁决采用开放式处理。严格协议下,每次探测独立运行这套流程。