论文

SWE-WebDevBench:评估作为虚拟软件机构的 编码智能体 应用程序平台

SWE-WebDevBench: Evaluating Coding Agent Application Platforms as Virtual Software Agencies

智能体系统Agent任务评测

摘要

“vibe 编码”平台的出现,用户用自然语言描述应用程序,人工智能代理自主生成全栈软件,这就产生了对代码级基准之外的严格评估的需求。为了评估他们作为虚拟软件开发机构在理解业务需求、制定架构决策、编写生产代码、处理迭代修改和保持业务准备状态方面的能力,我们引入了 SWE-WebDev Bench,这是一个 68 指标评估框架,涵盖七个组中的 25 个主要指标和 43 个诊断指标,按照三个维度进行组织:交互模式(应用程序创建请求 (ACR) 与应用程序修改请求 (AMR))、代理角度(产品经理 (PM)、工程、运营)和复杂性层(T4 多角色 SaaS、T5 原生 AI)。我们的评估(六个平台、三个领域、18 个评估单元)揭示了当前一代人工智能应用程序构建器中的四个反复出现的缺点:(1) 规范瓶颈,平台将丰富的业务需求压缩为过于简单的技术计划;(2) 普遍的前端后端解耦,视觉上精美的 UI 掩盖了后端基础设施的缺失或损坏;(3) 陡峭的生产就绪悬崖,没有一个平台在工程质量上得分超过 60%,而且不同平台的后期人力差异很大(4) 广泛的安全和基础设施故障,没有一个平台的安全得分超过 65%,而目标是 90%,并发处理低至 6%。这些观察结果描述了我们的样本,需要更大规模的复制才能建立普遍性。我们发布 SWE-WebDev Bench 作为社区基准,以实现此类复制并帮助平台构建者识别和解决这些差距。代码和基准测试资源位于:https://github.com/snowmountainAi/webdevbench 和 https://webdevbench.com/。