论文

DeferMem:通过强化学习实现长期代理记忆的查询时证据 蒸馏

DeferMem: Query-Time Evidence Distillation via Reinforcement Learning for Long-Term Agent Memory

上下文与知识记忆Agent记忆

摘要

大语言模型 (LLM) 智能体仍然难以有效地使用长期记忆,支持答案的证据通常分散在长期的对话历史中,并埋藏在大量不相关的内容中。现有的存储器系统通常在知道未来的查询之前将存储器处理成专用单元,并在查询时检索这些预先构造的单元。由于这些单元的内容和粒度是在知道当前查询之前确定的,因此检索到的单元对于该查询可能保持粗糙和嘈杂,从而使下游应答者进一步对它们进行去噪并发现特定于查询的证据。我们提出了 DeferMem,一个长期记忆框架,它将这个问题分解为高召回率候选检索和查询条件证据 蒸馏。 DeferMem 使用轻量级的段链接结构来组织原始历史记录并在查询时检索广泛的候选者。然后,记忆蒸馏器将这些高召回率但高噪音的候选者蒸馏成一组忠实的、独立的和查询条件的证据。为了训练这个蒸馏器,我们引入了 DistillPO,这是一种强化学习算法,它将检索后证据 蒸馏 制定为包括消息选择和证据重写的结构化动作。它通过分解和门控的奖励管道和结构一致的优势分配来优化这一行动,将奖励组件从有效性到质量检查进行门控,同时尽早公开与可回答性相关的反馈,并将每个奖励分配到其负责的输出范围。在 LoCoMo 和 LongMemEval-S 上,DeferMem 超越了 QA 准确性和记忆系统效率方面的强大基线,实现了最高的 QA 准确性和最快的运行时间,同时不消耗任何商业 API 词元进行内存操作。