论文

Agent跨多类任务改进自身运行框架

Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer

智能体系统Agent Harness智能体自我改进递归自我改进(RSI)

摘要

Harness是围绕语言模型Agent的代码,用于组织提示、调用工具、管理上下文和控制执行。随着模型变得越来越强大,最近的工作已经开始让智能体改进自己的Harness,这一工作被称为自我进化Harness。在大多数现有方法中,在人工设计的工具上运行的单独提议器会修改求解器的工具,并为每个基准演化出单独的工具。现实世界的任务来自许多领域,因此Harness的演变和评估都应该涵盖不同的任务范围。我们提出了一个接近递归自我改进的框架:相同的冻结模型,在同一版本的Harness上,首先作为求解器解决任务,然后作为提议者读取完整的运行记录并直接编辑运行它的Harness。每个进化批次从不同领域的五个基准中提取任务。为了衡量泛化性,训练和保留任务是严格分开的,我们还对进化过程中从未使用过的五个分布外基准进行了评估。我们将进化过程定义为具有两个阶段的深度学习训练:多任务预训练和持续训练。从 49 行种子Harness开始,第一阶段结束时获得的Harness在分布内基准上提高了 4.48 分,在分布外基准上提高了 12.64 分,前者超过了 Codex,后者与后者相当。在第二阶段,Claw-Eval(发行外基准测试之一)的持续发展,进一步将该基准分数从 66.17 提高到 68.06,超过了 Codex。我们还对进化过程中出现的机制进行了深入分析,包括输出截断、历史压缩和独立审查。