论文

AgentDevel:将自进化 LLM 智能体重构为发布工程

AgentDevel: Reframing Self-Evolving LLM Agents as Release Engineering

AI 基础设施智能体系统Agent Harness智能体自我改进AI 开发与运维平台

摘要

大语言模型(LLM)智能体的近期进展大多聚焦于在智能体内部嵌入自我改进机制,或在众多并发变体之间搜索。这些方法虽然能提高聚合分数,但往往产生不稳定且难以审计的改进轨迹,使人难以保证不发生回归,也难以跨版本推断失败原因。我们将智能体改进重构为发布工程(release engineering):智能体被视为可交付的制品,改进被外化为一条具备回归感知的发布流水线。我们提出 AgentDevel,一个发布工程流水线:它迭代运行当前智能体,从执行轨迹中产生与实现无关的、症状级的质量信号,通过可执行诊断合成单一发布候选(RC),并在以翻转为中心的门控下晋升该候选。AgentDevel 具有三个核心设计:(i) 与实现无关的 LLM 评审器,在不接触智能体内部的情况下刻画失败的表现形态;(ii) 基于脚本的可执行诊断,聚合主导症状模式并产出可审计的工程规格;(iii) 以翻转为中心的门控,将通过到失败的回归与失败到通过的修复作为一等证据优先处理。与基于种群的搜索或智能体内自我精修不同,AgentDevel 维护单一规范版本线,并把不回归作为首要目标。在执行密集型基准上的实验表明,AgentDevel 以显著更少的回归带来稳定改进,同时产出可复现、可审计的制品。总体而言,AgentDevel 为像软件开发一样构建、调试与发布 LLM 智能体提供了一种实用的开发纪律。

AgentDevel:将自进化 LLM 智能体重构为发布工程 配图
图 1:AgentDevel 的主流水线