论文
AgentEvolver:在任务执行中累积可复用系统能力
AgentEvolver: System-Wide Self-Evolution Through Task Execution
摘要
代理可以在不改进任务工作方式的情况下完成任务。将任务经验转化为可重用的能力需要将更改的组件与其评估和后续使用联系起来。我们推出了 AgentEvolver,这是一个在任务执行期间开发功能同时保持基础模型固定的系统。八个实体系列通过公共版本化生命周期公开可重用操作、方法、代理、控制流、接口和支持状态以进行修订。共享的运行时协调正在进行的工作,而持久的计划和可恢复的上下文保留任务方向和支持证据。我们在 SWE-bench Pro Public 上评估任务结果,并检查六个应用案例中的功能变化。该团队报告,进化后的分辨率为 82.08%,超出了其报告的未进化的基线。这些案例展示了保留的能力进入后来的网站、游戏和研究工作,同时还记录了不完整的目标和不成功的策略。这些发现将可重用组件的改进与最终任务的成功区分开来。 AgentEvolver为研究通过执行进行能力积累提供了具体的基础;独立任务转移和总开发成本仍然是悬而未决的问题。