论文

DeNovoSWE 构建从文档生成完整代码仓库的数据

DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch

模型评测智能体系统AI 基础设施应用与实践Agent任务评测Sandbox基准与评测资源编程Agent Sandbox

摘要

随着大语言模型编码Agent的能力提升,其预期任务正从修复现有代码库的局部缺陷,扩展为依据高层规范设计并实现完整软件仓库。但大规模、可验证的整仓生成数据稀缺,使此类长程软件工程训练仍然困难。我们提出大规模整仓生成数据集DeNovoSWE,包含4,818个高质量实例,每个实例都要求依据文档生成完整仓库。数据通过精心设计的沙箱Agent工作流自动构建,无需人工标注即可规模化整理。DeNovoSWE采用分而治之与评判—修复相结合的设计,并以难度感知轨迹过滤平衡数据质量及多样性。在该数据集上微调Qwen3-30B-A3B,显著提高长程软件工程能力,将其在BeyondSWE-Doc2Repo基准上的得分从5.8%提升至47.2%。

DeNovoSWE 构建从文档生成完整代码仓库的数据:DeNovoSWE及其扩展长程软件工程任务的作用。左侧:沿任务范围与难度扩展既有SWE数据集,从已有代码库的局部问题修复转向从零生成完整仓库
图1:DeNovoSWE及其扩展长程软件工程任务的作用。左侧:沿任务范围与难度扩展既有SWE数据集,从已有代码库的局部问题修复转向从零生成完整仓库,要求Agent从维护者式局部编辑转向架构师式仓库构建。右侧:提供4818项仓库生成任务,监督规模约为NL2Repo的46倍。