论文

先组织再检索:面向高效智能体的层级记忆导航

Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents

上下文与知识模型训练强化学习上下文工程记忆Agentic RLAgent记忆

摘要

大型语言模型(LLM)代理由于其固有的无状态性而难以应对长期任务,需要在不断增长的输入上下文中对所有与任务相关的信息进行编码。由此导致推理质量下降、推理成本增加和延迟增加,因此需要高效的工作记忆机制。然而,现有的方法要么依赖于有损压缩,要么依赖于基于相似性的检索,这通常无法捕获多步骤代理任务所需的时间结构和因果依赖性。在这项工作中,我们提出了 HORMA,一种分层组织和检索记忆代理,它将经验组织成类似文件系统的分层结构,其中汇总的实体链接到相应的原始轨迹,从而实现高效访问而不丢失详细信息。 HORMA 将工作记忆分解为两个阶段:结构化记忆构建和基于导航的检索。构建模块通过区分由丢失信息引起的失败和由误导或过载上下文引起的失败,迭代地完善体验的构建方式。导航模块通过使用经过强化学习训练的轻量级代理遍历层次结构来检索任务相关上下文,以选择最少但足够的上下文,从而减少关键执行路径上的延迟。在 ALFWorld、LoCoMo 和 LongMemEval 中,HORMA 在受限上下文预算下提高了任务性能,同时在长对话任务中最多需要 22.17% 的基准词元使用量。与现有方法相比,它始终能够实现更好的效率与性能权衡,并有效地推广到未见过的任务。

先组织再检索:面向高效智能体的层级记忆导航:论文配图
图 1:HORMA 框架概述。该系统旨在解决长期问题(0),并明确地将工作记忆解耦为两个专门的模块(1)和(2),并附有其专用的检索训练和验证基准(3和4):(1)分层管理代理,它使用递归技能细化将原始轨迹组织成文件系统工作空间内的结构化链接笔记; (2) 分层检索代理,它使用 Bash 工具和终端操作来导航此分层结构以选择与任务相关的上下文。