论文

HarnessBank:带有门控验证的语义基因库搜索,用于代理Harness自我进化

HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution

智能体系统Agent Harness

摘要

大语言模型 (LLM) 启用了跨不同应用程序的功能代理。除了基础模型之外,智能体的性能还受到周围智能体工具的控制,包括提示、工具、控制循环等。自动进化该工具为智能体改进提供了一条有希望的途径,但现有的方法通常依赖于贪婪的候选选择和嘈杂的自生成反馈,使得它们的收益容易受到搜索崩溃、特定于任务的过度拟合和可验证性差的影响。为了应对这些挑战,我们引入了 HarnessBank,这是一个值得信赖的代理-Harness自进化框架,它将任务代理与单独的进化代理配对,以进行迭代故障诊断、Harness生成和进化验证。 HarnessBank 维护着一个由不同语义坐标的高性能 Harness 组成的 Harness 基因库。这些工具在自我进化过程中被重新发明、重新组合、筛选和选择。此外,我们提出了门控Harness筛选机制,以有效过滤高质量Harness并降低评估大量后代Harness的成本。在七个代理基准测试中,HarnessBank 的性能持续提升,从 5.1% 提高到 15.4%。跨模型实验进一步验证了改进来自特定于模型的自我进化过程,而不是普遍最优的利用。我们的代码将在接受后公开。