论文

R^2-Mem:记忆搜索的反思体验

R^2-Mem: Reflective Experience for Memory Search

上下文与知识记忆Agent记忆

摘要

深度搜索最近已成为一种有前途的范例,使代理能够检索细粒度的历史信息,而无需预先管理大量记忆。然而,现有的记忆系统深度搜索代理会重复过去的错误行为,因为它们无法从先前的高质量和低质量搜索轨迹中学习。为了解决这个限制,我们提出了 R^2-Mem,一种用于记忆搜索系统的反思体验框架。在离线阶段,Rubric 引导的评估器对历史轨迹中的低质量和高质量步骤进行评分,而自我反思学习器则提炼相应的抽象经验。在在线推理过程中,检索到的经验将指导未来的搜索行为,以避免重复错误并保持高质量的行为。大量实验表明,R^2-Mem 在强基线上持续提高了有效性和效率,将 F1 分数提高了 22.6%,同时将词元消耗减少了 12.9%,搜索迭代次数减少了 20.2%。这些结果验证了 R^2-Mem 为自我改进的 LLM 智能体提供了一种无 RL 且低成本的解决方案。