论文

指定和维护代理工作流:GitHub 代理工作流的实证研究

Specifying and Maintaining Agentic Workflows: An Empirical Study of GitHub Agentic Workflows

智能体系统Agent Harness

摘要

代理工作流程将软件开发从提示人工智能代理执行单个任务转变为定义代理自动执行的重复工作。 GitHub Agentic Workflows (gh-aw) 通过 Markdown 文件实现这种方法,该文件将自然语言指令与配置结合起来,并编译成可执行的 GitHub Actions 工作流程。与主要规定脚本操作的传统工作流程不同,这些文件将需要解释的任务委托给人工智能代理。它们还将代理指令与执行触发器结合起来,使这些指令成为重复存储库活动的操作规范。然而,开发人员如何构建和维护这些规范,以及它们所表达的执行要求和保障措施,仍然没有得到充分的了解。在本文中,我们研究了 gh-aw Markdown 文件的结构、演变和指令内容,以告知从业者如何定义和维护代理运行的工作。我们分析了来自 276 个存储库的 1,248 个文件、20,841 个提交文件事件以及来自 294 个文件样本的 288 个解析指令标签集。我们的结果表明,工作流程指令超出了简短的提示,62.1% 的文件中平均有 556.5 个单词和代码块。在观察活动至少 120 天的文件中,78.2% 的文件在第 4 个月仍会收到更新,而大小标准化流失率在第 1 个月后有所下降。任务、输出、约束和流程指令均出现在超过 93% 的标记工作流程中,但只有 9.4% 明确解决了提示注入防御问题。相对于已解析的人类标签,LLM 分类的 F1 分数为 0.818,Cohen 的 Kappa 为 0.715。这些发现表明,开发人员应考虑跨存储库复制或引用的工作流程的演变,并考虑在适用的情况下添加即时注入防御、资源预算和证据可信度检查。