论文

SAM:面向长时程推理智能体的状态自适应记忆

SAM: State-Adaptive Memory for Long-Horizon Reasoning Agent

上下文与知识模型训练强化学习上下文工程记忆Agentic RLAgent记忆

摘要

长时程智能体推理要求大语言模型在包含思考、工具调用、观测和阶段性结论的长交互历史上行动。挑战不仅在于这些历史会变得很长,还在于当前决策所需的信息可能分散在遥远的步骤中,且只在之后才变得相关。现有方法通过截断交互历史、将其压缩为更短的替身、或检索其中选定部分加以复用来应对这一困难,但都没有显式建模对过去交互的访问应如何随智能体不断演化的状态而调整。我们转而将长时程推理视为一个状态自适应记忆问题。为此,我们提出State-Adaptive Memory(SAM),一个独立框架,它将持续进行的交互整合为紧凑的记忆线索,同时保留原始轨迹页以供意图驱动的召回。这些线索不被当作历史的替代品,而是作为轻量级的抓手,让智能体能够按当前需要重构时间上遥远的信息,且无需重新训练底层骨干模型。我们进一步通过专家引导的监督和强化学习优化记忆模块,使其与轨迹级效用对齐。在BrowseComp、BrowseComp-ZH、WideSearch和HLE上,SAM在多种智能体骨干上一致优于强基线。我们的结果表明,显式记忆建模为长时程智能体推理提供了一个简单而有效的基础。

SAM:面向长时程推理智能体的状态自适应记忆:论文配图
图 1:SAM 概述。左上:基于页面的整合用紧凑的内存提示替换原始交互历史记录,同时在外部存储相应的原始页面。右上:给定回忆意图,代理选择候选线索,SAM 从相关页面重建决策相关信息。底部:记忆模块首先使用专家轨迹进行训练,然后使用强化学习进行细化。