论文
OpenLoopEvolve:面向长程复杂任务循环策略的可验证自进化框架
OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks
摘要
长程复杂任务要求智能体在持续变化的环境中反复观察状态、制定计划、调用工具、验证结果并从失败中恢复。然而,这类控制经验往往局限于单一上下文或固定提示词,难以在历史轨迹间积累和复用。本文提出OpenLoopEvolve(OLE),一个以循环策略(Loop Policy)为中心的自进化框架。OLE将智能体的观察、规划、记忆、行动、验证、恢复、停止与预算控制表示为带版本和谱系的可移植策略资产,并提供可按实际需要选择的在线与离线进化模式:在线模式基于持续运行的反馈触发候选生成,离线模式则从归档轨迹和失败证据中搜索候选策略。两种模式共享由大语言模型自主提案、冠军-挑战者配对评估和稳健发布组成的进化机制。在线发布的策略在后续任务边界激活,通过后续反馈监控,并在满足退化条件时回滚到其父版本。在模拟商业基准YC-Bench上,相对于固定的初始循环策略,两种模式均提升了总体任务表现、任务成功率和风险指标。结果表明,将循环策略视为可治理的资产,可以支持控制经验的积累、比较、发布和复用,并提升智能体在长程复杂任务上的表现。
