论文
超越提示:测量与优化LLM工具Agent的Harness
Beyond Prompts: Measuring and Optimizing LLM Tool-Agent Harnesses
摘要
通过围绕固定模型修改运行时工具,无需重新训练即可改进 LLM 工具智能体:提示、工具接口、中间件、状态处理和恢复逻辑。我们将此设置研究为固定模型多轮工具智能体的资源有限Harness选择,搜索表面范围为提示和工具边界中间件:编辑是工具边界处的受保护拦截,而不是任意重写智能体执行逻辑。我们的与优化器无关的协议报告意味着保留提升、最坏条件提升、可重复性、记录的成本诊断和 RelLift95(B),这是对预算 B 下选择的工具的保留增益的保守估计。我们使用仅提示和提示加中间件优化器实例化协议,包括 PRISM,它对故障进行集群并将修复路由到提示、工具边界中间件或 Pareto 搜索中的联合编辑表面。在 BFCL 多轮、tau2-Retail 和 tau2-Telecom 上,PRISM 在所有三个基准上获得了 14.2、14.9 和 10.1 个百分点的平均保留提升以及正经验 RelLift95,并且组件消融将裕度主要归因于故障表面路由和编辑模式约束。在优化器中,结果表明,某些搜索过程偶尔会发现较大的增益,但仍然选择脆弱的更新,因此应将所选工具的可靠性与平均保留提升一起报告。
