论文

可预测代理系统的利用工程:确定性执行约束的实证研究

Harness Engineering for Predictable Agentic Systems: An Empirical Study of Deterministic Execution Constraints

智能体系统Agent Harness

摘要

即使给定相同的任务和工具,基于 大语言模型 (LLM) 的代理也会表现出巨大的运行间执行差异——对于探索性使用来说是可以接受的,但在财务和合规性等监管领域是不可接受的。我们研究利用工程:将代理包装在确定性执行层(有限状态控制、强制工具选择、输出验证、有界重试和结构化规划)中,并测量其对执行确定性和任务成功的影响。在两个综合任务(金融和法律)和两个开放权重模型(Qwen-2.5-7B-Instruct、Gemma-3-27B)中,首次通过Harness会产生混合结果:它显着提高了四个模型任务单元之一的可重复性,显着降低了两个模型任务单元的可重复性,并且在第四个任务单元中没有效果。跟踪级诊断找到了原因:一旦工具序列、状态序列和输出已经高度一致,无约束的自由文本规划步骤就成为主要的剩余方差来源。添加结构化规划(在调用任何工具之前根据固定模式验证计划)完全消除了这种影响:四个单元中的三个在 N=100 时达到了 1.000 的再现率和确定性指数,并且四个单元中的三个中的任务成功率上升到 100%。收益不是免费的:每个单元的词元成本都会下降,但延迟显示出真正的、样本大小稳健的模型分裂——一个在约束下变得更快,另一个明显变慢。我们认为,Harness工程对于代理可靠性来说是一门独特、有效的学科,但其成本取决于模型,必须进行测量,而不是假设。