论文

从可运行到可交付:根据需求生成全栈 Web 应用程序的多代理测试驱动开发

From Runnable to Shippable: Multi-Agent Test-Driven Development for Generating Full-Stack Web Applications from Requirements

智能体系统Agent 架构与控制循环

摘要

编码智能体 可以生成可运行的 Web 应用程序,但其输出经常无法满足功能要求。尽管测试驱动开发 (TDD) 提供了原则性的修复循环,但将其应用于 Web 应用程序需要派生可执行的验收测试、通过动态浏览器交互验证行为,以及将观察到的故障转化为可操作的反馈。我们推出了 TDDev,这是一种实验工具,可以自动执行这些任务,并以最少的人工干预实现闭环 TDD。使用 TDDev,我们针对 20 个不同 Web 应用程序、多个骨干模型、两个 编码智能体 和三个 TDD 实现的全栈 Web 应用程序生成进行了首次 TDD 受控研究。凭借足够强大的骨干网,TDD 将准确性提高了 15.5--23.7 个百分点,并且在最小和全功能 编码智能体 上仍然有效;用更强大的测试仪替换不可靠的反馈可以为能力较低的骨干恢复积极的收益。增量 TDD 提供有界控制,整个项目 TDD 支持协调修复并在大多数配置中实现最高成本效率,而 Agentic TDD 在高性能模型上表现最佳。基于这些发现,我们提供了一个实用的决策树,根据模型功能、反馈可靠性和部署目标来选择实现。通过自动化验收测试和故障引导修复,TDDev 还减少了开发过程中所需的人工测试和干预。