论文
更好的Harness,更小的模型:通过自动Harness适应构建便宜 90% 的代理
Better Harnesses, Smaller Models: Building 90% Cheaper Agents via Automated Harness Adaptation
摘要
Frontier LLM 代理正在自动化许多业务任务,但其高推理成本使得大规模部署不可持续。小语言模型 (SLM) 提供了一种更便宜的替代方案,但当更换为为前沿 LLM 设计的工具时,它们通常会出现不足。我们表明,对于许多日常业务任务,SLM 代理与可被元代理自动发现的改编工具配合使用时,可以以降低 90% 的成本与 LLM 性能相匹配。关键的见解是,大部分任务难度是跨实例共享的,并且可以通过定制的指令、工具和编排循环从模型提升到工具中。为了系统地研究这个问题,我们创建了一个框架,将代理故障模式映射到Harness适应策略,并构建一个Harness优化器,自动从故障轨迹中发现有效的适应。在七个面向业务的代理任务和三个 SLM 系列中,我们发现优化的工具显着提高了 21 个任务 SLM 对中的 16 个的性能,其中 7 对缩小了 SLM-LLM 性能差距,最佳 SLM 代理以 4% 的成本恢复了 LLM 性能的 89.7%。我们的分析进一步表明,适应最适合具有更多重复工作流程的任务和具有足够基础功能的 SLM。总之,这些结果表明,Harness适应可以扩大 SLM 代理在日常业务任务中的实际部署范围。