论文

DREvo:提炼重新校准的历史经验以实现自我进化

DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution

智能体系统Agent Harness

摘要

Harness在 大语言模型 代理性能中起着至关重要的作用,构建高性能Harness需要大量的专家努力。因此,最近的研究越来越多地探索Harness的自我进化,即利用历史试验经验迭代地提出、评估和改进Harness。然而,积累的历史经验并不总能转化为稳定的搜索指导,并且性能通常在进化迭代中大幅波动,使得在有限的进化预算下可靠地发现高性能Harness变得困难。我们发现现有的Harness自我进化方法如何利用历史经验存在两个局限性:(1)缺乏对历史经验对于当前Harness是否仍然有效的动态重新评估,以及(2)缺乏将有效的历史经验转化为可操作的搜索方向的明确机制。为了解决这些限制,我们提出了一种新的工具自进化方法,名为 DREvo,它集成了功能级证据锚定、状态相关的证据重新校准和角色条件搜索意图 蒸馏 来确定哪些历史证据仍然有效以及工具接下来应该在哪里进化。在有限的演化预算下,DREvo 表现出更平滑的演化轨迹,在所有五个基准上实现了最高的准确度,并且在领域推理和代理任务的评估基准上分别实现了 16.2% 和 14.2% 的平均增益。