论文

TreeMem:多智能体记忆系统的树式贡献分配

Tree-based Credit Assignment for Multi-Agent Memory System

模型训练奖励建模与过程监督

摘要

记忆系统被广泛采用来增强 LLM 的长期任务,并且通常被组织为具有记忆构建、总结和检索代理的多代理管道。为了增强该系统的能力,现有的基于强化学习的方法要么对所有智能体统一应用最终的下游任务奖励(例如,QA 准确性),但这些奖励是粗糙且模糊的;或者为不同子任务的智能体设计特定于任务的奖励,这需要昂贵的注释(例如,关键证据)并且难以可靠地定义。为了解决这些限制,我们提出了基于树的多智能体记忆系统贡献分配(TreeMem),它从最终奖励中得出特定于智能体的信用,而无需特定于任务的注释。具体来说,TreeMem 将多智能体管道(构建器 - 汇总器 - 检索)扩展为树结构,其中每个智能体的输出都扩展为多个后续分支。每个智能体的贡献是通过蒙特卡罗对其后续分支进行平均来估计的,捕捉中间智能体的行为如何影响最终的奖励。这会将粗略的最终奖励转换为特定于代理的优化信号。然后,这些信号用于同时更新所有代理策略,帮助异构代理有效地专业化。长期基准测试表明,TreeMem 在强基线上提高了记忆系统性能,验证了多智能体记忆系统树形结构贡献分配的有效性。