论文

支架内部:编码智能体 架构的源代码分类

Inside the Scaffold: A Source-Code Taxonomy of Coding Agent Architectures

智能体系统Agent Harness

摘要

基于 LLM 的 编码智能体 可以在减少人工监督的情况下定位错误、生成补丁并运行测试,但围绕语言模型(控制循环、工具定义、状态管理和上下文策略)的脚手架代码仍然知之甚少。现有的调查通过抽象能力(工具使用、规划、反思)对代理进行分类,这些能力无法区分架构上不同的系统,而轨迹研究观察代理的行为,而不检查确定原因的脚手架代码。本文提出了一种源代码级架构分类法,该分类法源自对固定提交哈希的 13 个开源 编码智能体 支架的分析。每个代理都具有 12 个维度的特征,分为三层:控制架构、工具和环境接口以及资源管理。分析表明,脚手架架构抵制离散分类:控制策略范围从固定管道到蒙特卡罗树搜索,工具计数范围从 0 到 37,上下文压缩涵盖七种不同的策略。五个循环原语(ReAct、生成-测试-修复、计划-执行、多次尝试重试、树搜索)充当可组合构建块,以不同的组合进行代理分层; 13 个代理中的 11 个由多个原语组成,而不是依赖于单个控制结构。当外部约束占主导地位(工具功能类别、编辑格式、执行隔离)时,维度会聚合;而当开放设计问题仍然存在时(上下文压缩、状态管理、多模型路由),维度会出现分歧。所有分类声明都基于文件路径和行号,为研究代理行为的研究人员和设计新支架的从业者提供可重用的参考。