论文

生长Harness而非扩展上下文:从无策略脚手架到可复用专家Agent

Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents

智能体系统上下文与知识上下文工程Agent Harness

摘要

大语言模型(LLM)Agent常常处理一系列相关任务,但标准harness反复要求模型在每个任务的上下文内重建同样的控制决策。我们研究能否转而让任务反馈把反复出现的控制变成可复用的可执行代码,同时把LLM调用保留给任务特定的语义推理。我们提出Growing Harness,一种失败引导的训练范式,从一个无策略脚手架——暴露固定的模型与工具接口但不编码任何解题控制器——学习Agent harness本身。函数级执行轨迹把每个失败定位到有界的代码表面,优化器联合修复一段失败窗口,成功优先的留出门控回滚损害既有能力的修复序列。被接受的编辑累积到一个共享harness中,使其控制结构从任务反馈中涌现。在BrowseComp-Plus与WebArena-Verified上、跨三个从4B到120B参数的部署模型,Growing Harness在六个基准-模型设置中的五个取得最高平均成功率,第六个仅落后最佳平均0.7个百分点。相对工具调用Agent,它减少76.0%—91.8%的LLM调用与74.4%—98.6%的部署Agent推理成本。在WebArena-Verified上,其成功率在各模型规模下保持44.7%—45.3%,而工具调用Agent在4B模型下跌至6.7%。消融显示轨迹局部编辑、联合修复与基于门控的回滚各自提升最终成功率。这些结果表明,持续的程序生长可以把反复出现的控制从模型上下文移入低成本代码,产生在更小部署模型下依然有效的可复用专家Agent。

生长Harness而非扩展上下文:从无策略脚手架到可复用专家Agent:论文配图
图2:Growing Harness 概览。从不含策略的初始框架 h₀ 开始,每轮追踪一次失败执行,定位出错函数,诊断背后的控制策略问题,并修复函数级代码。仅在候选修改修复足够多的失败且保持留出任务成功率时接受。