论文

魔鬼就在界面中:评估工具架构如何塑造 编码智能体 行为

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior

智能体系统Agent HarnessAgent任务评测

摘要

随着 大语言模型 的不断改进,代理系统变得越来越重要,而工具是一个关键的设计维度,因为它们决定代理如何访问信息并在其环境中采取行动。先前有关代理工具的工作主要集中于扩展代理的功能,但很少系统地关注如何组织这些功能并将其暴露给模型。我们将后一个设计维度称为工具架构。我们通过存储库级问题修复的受控实验来研究 编码智能体 中的工具架构,比较了六种工具架构,这些工具架构保持相似的底层信息和操作,同时改变它们的组织方式和暴露给模型的方式,跨越三个参与者和总共 11,700 个轨迹。我们的实验表明,即使工具提供类似的功能,工具架构也会改变代理行为:与代理仅具有 bash 工具的基本架构相比,更结构化的底层接口可将重复尝试的一致性提高高达 4.7 $\times$;自然语言搜索拓宽了存储库探索范围,并将相关文件的访问量提高了 11% 以上;和 Python CodeAct 风格的接口实现了类似的任务性能,但步骤减少了 41.6%,词元使用率降低了 56.3%。相比之下,轻量级的基于文本的认知支架工具,例如让代理记录中间推理的工具,对参与者行为的影响有限。