论文

EvoUndo:可恢复性约束下的大语言模型智能体Harness自我演化

EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses

智能体系统Agent 动作执行与治理Agent Harness智能体自我改进

摘要

LLM 代理越来越多地在运行时修改自己的提示、工具、中间件、资源和执行工具。这种自我进化可以提高能力,但成功的突变可能会留下持久的影响,而这些影响在不同于其创建时的状态下无法安全逆转。我们引入了 EvoUndo,一个用于表示、综合、诊断和独立验证模型生成的跨反事实状态的自我修改的可恢复性的框架。在 600 个未见过的一次性自我进化任务中,我们发现了 197 个未能通过可恢复性验证的能力改进突变。在原始恢复表示下,传统修复策略可以恢复这些自然故障的 0/197。确定性预言机分析在原始恢复语言 L0 下恢复了 48/197,而扩展恢复演算将经验预言机恢复率提高到 191/197。然后,协议锁定的 2x2 表达性接地干预将两个瓶颈分开:当原始语言足够时,精确的状态地址接地将成功恢复率从 0/48 提高到 38/48 (79.2%),而扩展恢复语言可以在 Oracle 定义的 S1 层中实现 142/143 (99.3%) 故障的恢复。在主要的 gpt-oss-120b 主干上,向更丰富的语言添加精确地址诊断可将恢复率降低至 133/143 (93.0%); Qwen3.8-27B 复制保留了基础和表达性效应,但没有保留这种负面相互作用,表明后者是模型相关的。这些结果表明,可靠的智能体自我进化需要共同设计验证、状态基础、见证语义和恢复语言表达能力,而不是仅仅依赖迭代提示。