论文
AgentMemGate:阻止会话记忆中的推测污染
AgentMemGate: Addressing Speculation Contamination in Conversational Assistant Memory
摘要
具有长期记忆的对话式 AI 助手从用户消息中提取事实,并将其存储到稍后对话中查阅的存储中。规定的计划可以作为事实进入该商店:可能搬到西雅图的用户可能会被记录为已经居住在那里。我们称之为投机污染。最终状态记忆基准测试会遗漏此错误,因为它们没有 探针 中间状态并且包含一些未解决的推测。我们提出了 AgentMemGate,这是一个用于配置文件存储记忆的写入时门,它将提取的语句分类为推测、已完成的事件、更正或其他。猜测仍然在记忆之外,并具有管理以后升级或删除的条件。我们还提供了多会话对话的数据集,其中计划被确认、放弃或未解决。在我们的 147 个对话 保留测试 集合中,Mem0 和 Graphiti 将 35.2% 和 27.3% 的未决计划断言为当前状态。在核心基准测试中,AgentMemGate 消除了相对于相同非门控管道的所有观察到的污染(对于最暴露的提取方式,从 87.5% 到零),并将任务准确性从 65% 提高到 95%。在较难的 保留测试 套装上,门控污染率为 3.4% 至 5.7%,任务准确性提高了 9 至 13 个百分点。我们的分析将字段匹配确定为主要的剩余瓶颈:现实的推测通常与配置文件字段不匹配,并且永远不会到达大门。我们发布数据集、提示和评估代码。