论文
自然语言代理Harness
Natural-Language Agent Harnesses
摘要
代理性能很大程度上取决于周围的工具:围绕组织任务运行的模型的外部执行系统。然而,这种逻辑通常隐藏在紧密耦合的控制器代码中,这使得Harness难以检查、比较、传输和消融。本文询问代理工具的可重用设计模式是否可以表示为可执行的自然语言对象。我们引入了自然语言代理工具 (NLAH)、描述运行级别工具策略的可编辑文档,以及智能工具运行时 (IHR),这是一个共享运行时,它将这些文档解释为代理调用、切换、状态更新、验证门和工件契约。在编码、终端使用和计算机使用基准方面,IHR 执行的 NLAH 实现了与代码相当的任务结果并提示实现,同时暴露了更短的静态控制策略。模块消融进一步表明显式Harness模块是可分析的。这些结果表明,代理工具可以从模型周围的偶然粘合物转变为科学表示对象。