论文

SaaSBench:评测编码智能体的企业级多组件系统建设

SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering

模型评测基准与评测资源

摘要

随着自主 编码智能体 能够处理越来越长的任务,它们逐渐展示了完成端到端软件开发的潜力。尽管现有的基准最近已经从本地化代码编辑发展到从头开始生成项目,但它们仍然局限于结构简化的单一技术栈应用程序。因此,他们无法捕获真实企业软件即服务 (SaaS) 系统的异构环境、全栈编排和系统级复杂性,从而在现实工程约束下评估代理方面留下了关键差距。为了填补这一空白,我们推出了 SaaSBench,这是第一个旨在探索企业 SaaS 工程中人工智能代理边界的基准测试。它跨越 6 个 SaaS 领域的 30 项复杂任务和 5,370 个验证节点,结合了 8 种编程语言、6 个数据库和 13 个框架,以细致地反映现实世界的软件异构性。此外,我们设计了一种依赖感知混合评估范式,专为具有长视野和多组件耦合的复杂系统量身定制,从而实现细粒度、可重复的评估。至关重要的是,我们广泛的实验揭示了一个惊人的见解:最先进代理的主要瓶颈不是生成孤立的代码逻辑,而是成功配置和集成多组件系统。超过 95% 的任务失败发生在代理甚至到达深层业务逻辑之前,模型经常成为过度自信的受害者,并在基础系统设置过程中过早停止,或者陷入无效的调试循环中。我们希望 SaaSBench 成为一个实用且具有挑战性的测试平台,以推动可靠的系统级 编码智能体 的发展。该代码可在 \url{https://github.com/ShadeCloak/SaaSbench} 获取。