论文

即时记忆:为LLM Agent学习任务自适应的记忆整理

Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents

上下文与知识记忆Agent记忆

摘要

Agent记忆系统复用过去经验以改进未来表现,但现有设计大多在写入时整理记忆:任务一旦完成,其轨迹就被蒸馏为固定产物,如反思、工作流、技能或推理策略,之后再通过相似性检索。这迫使系统在尚不知道未来查询的情况下决定什么值得记住,不可逆地丢弃信息,并产生必须服务众多可能下游任务的、与查询无关的摘要。学习这样的写入时整理器也很困难,因为一个存储决策的价值可能要到相关查询到来时才显现,也许是许多任务之后,形成长时程的信用分配问题。我们改为保留原始轨迹,把整理推迟到读取时——即当前任务已知之时。给定检索到的轨迹与新任务,记忆整理器会合成一个贴合当前需要的紧凑、任务自适应的有效负载。由于该负载在同一任务上被消费,整理器可以直接从即时任务成功中训练,避免了延迟的效用信号,也无需人为地将相关任务分组。在ALFWorld、WebShop和$\tau^2$-bench上,我们的Just-in-Time Memory(JitMem)持续优于无记忆Agent以及启发式和学习的写入时记忆方法,相对最强基线分别取得16.2、16.3和3.9个绝对成功率点的提升。值得注意的是,即便是未训练的整理器也已能与这些基线持平或超越,表明任务自适应的读取时整理本身就是收益的主要来源;对整理器加以训练则进一步放大改进。

即时记忆:为LLM Agent学习任务自适应的记忆整理:论文配图
图 1:JitMem 概览。(a) 推理流水线。给定当前任务 x(t),检索器从记忆库中取回原始轨迹;整理器以 x(t) 为条件将其蒸馏为任务自适应的载荷,注入执行器的上下文。执行完毕后,由执行器兼任评判评估正确性,成功的轨迹被存回记忆库。(b) 训练流水线。在每个训练步中,采样一个任务并从固定的训练库检索相关轨迹,随后整理器生成多个候选载荷。冻结的执行器分别用每个载荷尝试该任务并返回即时任务奖励,用于通过 GRPO 更新整理器。