论文
在测试时使用可重用原语组合特定于任务的Agent Harness
Composing Task-specific Agent Harnesses at Test Time with Reusable Primitives
摘要
Agent Harness控制大语言模型 (LLM) 如何收集上下文、调用工具、验证结果、保留状态和终止,这在很大程度上影响Agent性能。然而,每种利用机制的价值在异构任务中可能会有所不同:改进一项任务的机制可能会给另一项任务带来开销或上下文干扰,从而导致全局利用的次优性。我们将这种次优性描述为由固定机制选择引起的不匹配,从而激发了特定任务的Harness构建。尽管如此,为每个任务生成工具代码会带来生成和调试成本,并且随着生成更多机制,执行风险可能会加剧。为了应对这些挑战,我们引入了 Harness Primitives、具有明确应用范围的可重用 Harness 机制以及从失败的任务轨迹中挖掘的组合契约。基于 Harness Primitives,我们提出了 STITCH,这是一个框架,可以在给定任务信息的情况下选择合适的原语,并在测试时将它们编译成特定于任务的 Harnesses。这种分离可以实现特定于任务的利用,而无需在测试时生成或修复机制代码。大量实验表明,STITCH 不仅提高了Harness适应性和鲁棒性,而且还可以根据原始库大小进行扩展,将任务成功率比固定Harness基线提高多达 12 个百分点,超越 Codex CLI 等人工设计的Harness,同时保持测试时Harness组合开销仅为 2.7%,比从头开始生成特定于任务的Harness效率高 638 倍。最终,我们的工作表明,构建任务自适应Harness有利于完成不同的任务,并且构建可重用基元可能是实现这一目标的一条有希望的道路。