论文
在重要时记得:面向长程智能体的主动记忆智能体
Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents
摘要
在长程任务中,决策相关的状态常散布在扩展的轨迹中,而动作智能体必须浮现它并行动。随轨迹增长,任务需求、环境事实、既往尝试、诊断与开放子目标可能被埋进上下文窗口或推出其外——未能在需要时影响决策。我们称该失败模式为“行为状态衰减”。我们把记忆研究为主动干预机制而非被动检索。一个独立的记忆智能体与未经修改的动作智能体并行运行:从近期轨迹更新结构化记忆库,并决定是否注入基于记忆的提醒或保持沉默。该模块即插即用于前沿动作智能体与既有智能体治控。跨Terminal-Bench 2.0与τ²-Bench:它为更弱与更强的动作智能体都改善pass@1——Terminal-Bench上+8.3分、τ²-Bench上+6.8分。消融显示选择性干预优于被动库暴露、常开注入、仅顾问指导与通用检索。作为迈向开放权重记忆策略的早期步骤,我们用SFT与GRPO在SETA上训练Qwen3.5-27B——改善验证奖励并实现对Terminal-Bench的部分迁移。
