论文
从提示到流程:支持人工智能软件开发代理的流程分类和比较评估
From Prompt to Process: a Process Taxonomy and Comparative Assessment of Frameworks Supporting AI Software Development Agents
摘要
用于编程的人工智能工具不再只是自动完成或聊天助手:它们将自己组织为开发框架,具有流程、角色、工件和验证。最近的调查将代理和 LLM 用于软件工程,但缺少一项以将这些功能转化为流程的操作框架为中心的研究。我们使用功能包含标准和牵引力测量对主要来源进行了定向搜索,并选择了六个框架:GitHub Spec Kit、OpenSpec、BMAD Method、Get Shit Done (GSD)、Spec Kitty 和 Reversa。每个攻击都通过不同的路径攻击人工智能开发:完整和轻量级变体的规范驱动开发、代理驱动的敏捷规划、代理的上下文工程、工作树隔离和审查以及从遗留系统恢复操作规范。我们的核心贡献是六维流程分类:规范、背景、角色、执行、验证和可移植性,以及将其变成可复制工具的评分标准。我们将其应用于六个框架和一个样本外案例 Spec-Flow。有两个结果很突出。在已经采用某种流程的框架中,存在着融合:孤立的提示失去了中心地位,持久性工件、工作合同、可追溯性和人工审查成为减少歧义和协调代理的机制。而且没有一个框架能够强有力地涵盖所有六个维度,暴露了流程深度和跨代理的可移植性之间的结构性权衡。我们还发现了反复出现的风险:规范和代码之间的偏差、对生成的工件的过度信任、社区扩展的脆弱性、平台依赖性以及缺乏完整流程的基准。我们以实证评估的研究议程结束,重点关注中等质量指标、环境治理、安装安全性和可重复性。