论文

在重要时记得:面向长程智能体的主动记忆智能体

Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents

上下文与知识模型训练强化学习记忆RLVRAgentic RLAgent记忆

摘要

在长程任务中,决策相关的状态常散布在扩展的轨迹中,而动作智能体必须浮现它并行动。随轨迹增长,任务需求、环境事实、既往尝试、诊断与开放子目标可能被埋进上下文窗口或推出其外——未能在需要时影响决策。我们称该失败模式为“行为状态衰减”。我们把记忆研究为主动干预机制而非被动检索。一个独立的记忆智能体与未经修改的动作智能体并行运行:从近期轨迹更新结构化记忆库,并决定是否注入基于记忆的提醒或保持沉默。该模块即插即用于前沿动作智能体与既有智能体治控。跨Terminal-Bench 2.0与τ²-Bench:它为更弱与更强的动作智能体都改善pass@1——Terminal-Bench上+8.3分、τ²-Bench上+6.8分。消融显示选择性干预优于被动库暴露、常开注入、仅顾问指导与通用检索。作为迈向开放权重记忆策略的早期步骤,我们用SFT与GRPO在SETA上训练Qwen3.5-27B——改善验证奖励并实现对Terminal-Bench的部分迁移。

在重要时记得:面向长程智能体的主动记忆智能体:论文配图
图 1:系统集成。动作代理(左)与环境交互;记忆代理(右)并排运行,观察最近步骤和当前记忆存储的滑动窗口。在每 N 步中,都会调用内存代理来更新存储库,并可选择将上下文提醒注入到下一个操作代理调用中。图 2:内存代理内部结构。第一阶段通过工具调用管理内存库(状态、知识、程序条目)。第 2 阶段读取更新后的存储体,并发出 <context_for_action> 提醒或 <no_intervention/>。图 3:内存干预架构概述。 (a) 记忆代理作为一个单独的进程与未修改的动作代理一起运行。 (b) 在每个记忆步骤中,两阶段工作流程首先更新结构化记忆库,然后决定是否有任何记住的状态应进入动作代理的下一个决策。