论文

Recuris:面向长程Agent Harness的递归式经验-工作记忆演化

Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses

上下文与知识智能体系统记忆Agent HarnessAgent SkillsAgent记忆

摘要

递归自我改进(RSI)在长程任务中依然困难:不断增长的历史会遮蔽任务状态,并使技能调用错位。我们提出Recuris,一种面向长程agent harness的递归式经验-工作记忆架构:工作记忆追踪任务进度,并从经验记忆中引导技能选择,使技能使用锚定于当前需求而非完整历史。这种耦合还将执行过程转化为结构化证据,可将失败定位到具体的记忆组件。在各任务中,一个固定的Meta-Agent将这些证据转化为对技能记忆的局部化、经验证的更新,这些更新重塑执行并产生新证据,形成有界的递归记忆演化循环。在四个长程基准和十个模型上,Recuris在37个完成的模型-基准对中的35个上提升了任务成功率,将前沿模型带至SOTA级任务成功率:在tau-bench上为GPT-5.6 Sol增加17.8分,为Claude Opus 5增加15.6分,使Opus 5达到87.9%;在SkillFlow上为Qwen3.6-27B/35B分别增加16.6/13.5分。优势随交互时程增长而扩大,在最长任务上达+32.2分,常见长程失败最多下降80%。这些结果将递归演化的记忆定位为RSI的可扩展基础,使智能体能够持续将积累的经验转化为日益有效的长程行为。代码:https://github.com/Gen-Verse/Recuris

Recuris:面向长程Agent Harness的递归式经验-工作记忆演化:论文配图
图3:Recuris概览。(a) 任务内:工作记忆 w_t 跟踪每个目标及其已验证状态。在定义的执行事件处,调用策略 ρ 从经验记忆 ℰ 中检索匹配技能;智能体行动后,检查器集合 𝒞 只提交观察 o_t 所支持的状态变化。(b) 跨任务:结构化轨迹记录每一步的 (w_t, ℰ_t, a_t, o_t),因此固定的元智能体将每个诊断出的失败归因到某组件,并精确修补所涉组件。固定门控仅在候选修复了源任务且不在保留开发集上退化时才接纳候选;否则记忆保持不变。基础LLM与外层过程保持固定。