论文

学习不要忘记什么:从几千字节的学习中获得长期代理记忆

Learning What Not to Forget: Long-Horizon Agent Memory from a Few Kilobytes of Learning

上下文与知识记忆Agent记忆

摘要

长期运行的语言模型系统会积累超出上下文窗口的交互历史记录,因此它们必须不断地驱逐。当逐出策略删除任务关键细节(例如登录时发出的访问令牌或下一次调用所需的路径)时,操作将失败。我们提出了 LRE(学习相关性驱逐),这是一种千字节级、仅 CPU、无语言模型的评分器,它可以学习哪些历史单元是关键任务,并通过逐字提取来保留它们。在我们的实验中,在匹配预算比较下,没有基线在准确性成本平面上主导 LRE。在代理上,LRE 恢复了保留整个历史记录的 93% 的总体准确度(41.1 vs. 44.0),并且在最简单的任务上超出了 27%,同时要求零压缩机调用并将最坏情况的峰值提示减少了 52%。一项受控研究跟踪显示,LRE 在其他任务循环的情况下完成任务,与保留所有内容并解决其他运行策略无法完成的 14 个任务相比,完成一项此类任务的调用次数减少了 37%。在会话记忆方面,LRE 以零神经成本超越了密集编码器和标记修剪编码器,同时尺寸缩小了 295-1569 倍。在下游评估中,LRE 在 LoCoMo 上给出了最佳预算答案质量,读取的词元少了 68%。它的监督也可以是无注释的:仅对系统自身行为进行训练即可恢复监督评分器有效性的 95%。我们认为,因为 LLM 代理中的内存驱逐是一个保真度问题,所以它需要一个可部署的主动策略,其中未来的查询不可用并且确切的状态是决定性的,并且廉价的学习相关性就足够了。