论文
HarnessEvolve:从参考轨迹中学习以实现可靠的智能体自我进化
HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution
摘要
自我进化代理通过根据环境反馈优化其工具(提示、技能、工具和执行逻辑)来实现自治。然而,这种范式受到三个挑战的阻碍:\textit{信用分配失败},其中终端成功/失败反馈使得哪一步导致错误变得不明确; \textit{捷径学习},智能体记住特定于任务的模式而不是获得通用的能力;和 \textit{灾难性遗忘},其中不受保护的更新会降低以前获得的能力。在本文中,我们介绍了 HarnessEvolve,这是一个自进化框架,可以从参考轨迹中学习以实现可靠的智能体自进化。 HarnessEvolve 将执行代理与进化管道解耦,将执行、评估、优化和门控分配给独立的代理模块,从而实现可推广且稳定的工具改进。具体来说,HarnessEvolve 通过生成参考轨迹(给出 真值 答案时生成的执行路径)并将失败的执行与它们对齐以提取错误信号来克服信用分配失败,这些错误信号被聚集起来以揭示系统故障模式。为了防止捷径学习和灾难性遗忘,候选工具更新必须通过两个门:一个是过滤数据泄漏和提示膨胀的质量门,另一个是性能门,如果每个更新在当前批次上有所改进而不降低最近批次的性能,则接受每个更新,并在保留集上进行纪元结束验证,选择性能最佳的已接受代理快照。我们使用不同的模型和代理框架,对跨越开放域和企业场景的多个基准进行了广泛的实验。结果表明,HarnessEvolve 在所有基准和设置中始终优于最先进的基线,从而确认了跨任务域的可靠性。