论文
PILOT在环:长时程智能体的实时自我改进
PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
摘要
长时程智能体运行产生的经验既能改进当前运行,也能改进未来的工作。大多数自我改进方法只在执行结束后处理这些经验,因此无法重新引导正在进行的运行,也无法立即应用并验证从中学到的教训。我们认为自我改进应当是实时的:利用正在产生的经验既重新引导当前运行,也更新持久的harness。现有智能体架构并不能完全支持这一目标。单智能体自我校正把任务执行与轨迹评估放在同一上下文中,而子智能体委托虽分离了执行,却通常无法重新引导正在运行的子智能体。我们提出PILOT,一个用于实时自我改进的监督者-工作者harness,通过两个耦合机制实现:(1)实时转向,让独立的监督者在执行期间重新引导或中止当前工作者;(2)实时自我演化,把执行期间显现的程序和失败模式蒸馏为可复用的技能和记忆。在两个冻结骨干和三个基准上,PILOT在六个配置中的五个排名第一。在Terminal-Bench 2.0上,PILOT比对照harness最多高出9.8个百分点。在自我改进设置下,PILOT在GLM-5.1上提升14.6分,在Kimi-K2.6上提升12.4分;平均输出token分别下降42.9%和47.4%,而每百万输出token的成功评估数分别上升110.3%和134.0%。
