论文

OpenLoopEvolve:面向长程复杂任务循环策略的可验证自进化框架

OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks

智能体系统上下文与知识记忆Agent 架构与控制循环智能体自我改进Agent记忆

摘要

长程复杂任务要求智能体在持续变化的环境中反复观察状态、制定计划、调用工具、验证结果并从失败中恢复。然而,这类控制经验往往局限于单一上下文或固定提示词,难以在历史轨迹间积累和复用。本文提出OpenLoopEvolve(OLE),一个以循环策略(Loop Policy)为中心的自进化框架。OLE将智能体的观察、规划、记忆、行动、验证、恢复、停止与预算控制表示为带版本和谱系的可移植策略资产,并提供可按实际需要选择的在线与离线进化模式:在线模式基于持续运行的反馈触发候选生成,离线模式则从归档轨迹和失败证据中搜索候选策略。两种模式共享由大语言模型自主提案、冠军-挑战者配对评估和稳健发布组成的进化机制。在线发布的策略在后续任务边界激活,通过后续反馈监控,并在满足退化条件时回滚到其父版本。在模拟商业基准YC-Bench上,相对于固定的初始循环策略,两种模式均提升了总体任务表现、任务成功率和风险指标。结果表明,将循环策略视为可治理的资产,可以支持控制经验的积累、比较、发布和复用,并提升智能体在长程复杂任务上的表现。

OpenLoopEvolve:面向长程复杂任务循环策略的可验证自进化框架:论文配图
图1:OpenLoopEvolve总体框架。已发布的Loop Policy在后续某个任务边界被激活,进入宿主环境并控制长程任务中的交互,产生可归因的轨迹。这些轨迹在共享证据契约下被转化为进化证据,并进入在线或离线的Loop Policy进化。候选策略在与Champion相同的条件下进行评估,通过鲁棒门控后,作为带版本的策略资产发布,并在任务边界被激活。