论文

ProjDevBench:在端到端项目开发上评测AI编码Agent

ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development

智能体系统Agent任务评测

摘要

近期的编码agent能够根据简单提示生成完整的代码库,但现有评估聚焦于issue级别的缺陷修复,落后于端到端开发。我们提出ProjDevBench,一个端到端基准,它向编码agent提供项目需求并评估其产出的代码仓库。该基准将Online Judge(OJ)测试与LLM辅助代码评审相结合,从(1)系统架构设计、(2)功能正确性和(3)迭代式方案精化三个方面评估agent。我们整理了覆盖8个类别的20道编程题,既包括面向概念的任务,也包括真实应用场景,并评估了基于不同LLM后端构建的六个编码agent。我们的评估报告总体接受率为27.38%:agent能够处理基础功能与数据结构,但在复杂系统设计、时间复杂度优化和资源管理方面表现吃力。该基准已在 https://github.com/zsworld6/projdevbench 提供。

ProjDevBench:在端到端项目开发上评测AI编码Agent
图2:基准测试流程概览。