论文
RoadmapBench:评估跨版本升级的长期代理软件开发
RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades
摘要
编码智能体 越来越多地部署在实际软件开发中,其中单个版本迭代需要跨多个文件进行数月的协调工作。然而,大多数现有基准测试主要侧重于 Python 存储库中的单问题错误修复,具有粗略的通过/失败评估结果,因此无法捕获实际工程规模的长期、多目标开发。为了解决这一差距,我们推出了 RoadmapBench,这是 115 项长期编码任务的基准,基于 17 个存储库和 5 种编程语言的真正开源版本升级。每个任务将代理放置在源版本代码快照上,并提供多目标路线图指令,要求其实现目标版本中引入的功能,在 51 个文件中平均修改 3,700 行。我们对 13 个前沿模型进行了系统评估,发现即使是最强的 Claude-Opus-4.7 也只能解决 39.1% 的任务,而最弱的也只能完成 5.2%,与现有的错误修复基准形成鲜明对比,这表明长期软件开发在很大程度上仍然是一个未解决的问题。