论文

超越提示:测量与优化LLM工具Agent的Harness

Beyond Prompts: Measuring and Optimizing LLM Tool-Agent Harnesses

智能体系统Agent Harness

摘要

通过围绕固定模型修改运行时工具,无需重新训练即可改进 LLM 工具智能体:提示、工具接口、中间件、状态处理和恢复逻辑。我们将此设置研究为固定模型多轮工具智能体的资源有限Harness选择,搜索表面范围为提示和工具边界中间件:编辑是工具边界处的受保护拦截,而不是任意重写智能体执行逻辑。我们的与优化器无关的协议报告意味着保留提升、最坏条件提升、可重复性、记录的成本诊断和 RelLift95(B),这是对预算 B 下选择的工具的保留增益的保守估计。我们使用仅提示和提示加中间件优化器实例化协议,包括 PRISM,它对故障进行集群并将修复路由到提示、工具边界中间件或 Pareto 搜索中的联合编辑表面。在 BFCL 多轮、tau2-Retail 和 tau2-Telecom 上,PRISM 在所有三个基准上获得了 14.2、14.9 和 10.1 个百分点的平均保留提升以及正经验 RelLift95,并且组件消融将裕度主要归因于故障表面路由和编辑模式约束。在优化器中,结果表明,某些搜索过程偶尔会发现较大的增益,但仍然选择脆弱的更新,因此应将所选工具的可靠性与平均保留提升一起报告。

超越提示:测量与优化LLM工具Agent的Harness:论文配图
图 1:PRISM 环(第 4.3 节)。每一代,分析人员 LLM 都会根据根本原因对失败案例进行聚类,并将每个聚类路由到可以修复的表面:提示、中间件或两者兼而有之。候选Harness通过突变和交叉而演变,帕累托前沿保留了通过率和可靠性之间的最佳权衡,并且所选Harness在保留的记分卡上进行一次评估。