论文

PILOT在环:长时程智能体的实时自我改进

PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

智能体系统上下文与知识记忆Agent HarnessAgent SkillsAgent记忆

摘要

长时程智能体运行产生的经验既能改进当前运行,也能改进未来的工作。大多数自我改进方法只在执行结束后处理这些经验,因此无法重新引导正在进行的运行,也无法立即应用并验证从中学到的教训。我们认为自我改进应当是实时的:利用正在产生的经验既重新引导当前运行,也更新持久的harness。现有智能体架构并不能完全支持这一目标。单智能体自我校正把任务执行与轨迹评估放在同一上下文中,而子智能体委托虽分离了执行,却通常无法重新引导正在运行的子智能体。我们提出PILOT,一个用于实时自我改进的监督者-工作者harness,通过两个耦合机制实现:(1)实时转向,让独立的监督者在执行期间重新引导或中止当前工作者;(2)实时自我演化,把执行期间显现的程序和失败模式蒸馏为可复用的技能和记忆。在两个冻结骨干和三个基准上,PILOT在六个配置中的五个排名第一。在Terminal-Bench 2.0上,PILOT比对照harness最多高出9.8个百分点。在自我改进设置下,PILOT在GLM-5.1上提升14.6分,在Kimi-K2.6上提升12.4分;平均输出token分别下降42.9%和47.4%,而每百万输出token的成功评估数分别上升110.3%和134.0%。

PILOT在环:长时程智能体的实时自我改进:论文配图
图2:PILOT 通过两种机制实现实时自我改进:实时引导与实时自我演化。左上:单一 ReAct 循环没有独立于工作本身的监督。左下:主智能体只有在委派运行结束后才收到子智能体的输出。右侧:独立的监督者重定向或中止正在工作的执行者,从监督过程中提炼可复用的技能与记忆,并将演化后的 harness 提供给后续执行者。