论文
从研究中学习:迈向终身AgentHarness的进化
Learning from Research: Toward Lifelong Agent Harness Evolution
摘要
语言Agent有望解决日益复杂的任务,从而对持续改进的需求不断增长。一种有前途的方法是发展Agent Harness,即管理工具使用、内存管理和任务执行的软件,同时保持底层语言模型固定。最近的方法通过使用元编码Agent根据执行反馈修改Harness来自动化此过程。然而,依赖该Agent的现有知识和观察到的失败可能会限制探索并使适应变得被动。受到人类专家如何从研究文献中学习新解决方案的启发,我们推出了 ScholarEvolve,这是一个自动利用最先进的研究来指导Harness进化的框架。 ScholarEvolve 将Harness演化方向组织成功能模块,并使用主题建模来识别每个模块的不同改进策略。它实施这些策略并评估它们的组合以提高任务绩效。此外,该框架旨在随着时间的推移纳入新的出版物,从而使研究进步推动主动的终身发展。实验证明了 AppWorld 和 Tau2-Bench 的改进。 ScholarEvolve 将 AppWorld Challenge 上的 Qwen3.5-27B 任务目标完成率从 49.6% 提高到 63.6%,并将 Tau2-Bench Telecom 上的 GPT-5.4-mini pass@1 从 72.7% 提高到 81.9%。