论文

ECHO:通过 Agentic RL 中的选择性转向记忆进行修剪以行动,追踪以学习

ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL

模型训练上下文与知识强化学习上下文工程Agentic RL

摘要

长视野语言智能体必须反复与工具交互,积累证据,并在有界上下文窗口下做出决策。上下文管理方法通过删除、折叠或内存编辑来简化过去的交互,从而使此类执行轨迹变得可行。然而,当有用的历史被压缩成压缩状态时,重建的上下文可能不再揭示哪些早期观察支持成功的最终答案。这造成了有界上下文行为和基于结果的强化学习之间的不匹配:策略作用于重建的上下文,而学习者缺乏源级别的来源来将信用分配给重要的证据。我们提出了 ECHO,一种选择性转向记忆框架,用于 Agentic RL 中的可追踪上下文重建。 ECHO 将每个完成的环境转压缩为紧凑的源索引记忆记录,通过选择有用的记录来重建有界策略上下文,并重用所选的源索引将积极的结果信用路由到最终轨迹段,重用证据转、记忆发现和记忆选择操作。在 BrowseComp-Plus 上,ECHO 的保留准确度达到 43.4%,优于 GRPO(28.9%)和滚动摘要基线 SUPO(36.1%),同时比 SUPO 使用更少的转弯和更低的轨迹体积。经过训练的策略还提高了密集和 MoE 主干上多目标 QA、代码生成和深度信息搜索基准的零样本泛化。