论文

ScaleSWE 自动构建经验证的软件工程训练数据

Immersion in the GitHub Universe: Scaling Coding Agents to Mastery

应用与实践模型训练智能体系统AI 基础设施模型评测合成数据Agent 协作数据基础设施Sandbox基准与评测资源编程Agent Sandbox

摘要

现实软件工程任务的能力提升,受到大规模高质量训练数据不足的根本限制。环境配置、单元测试生成和问题描述整理的复杂性,使数据规模难以扩大。我们提出ScaleSWE,一个在沙箱中运行的自动多Agent工作流,用于大规模构建高质量软件工程数据。三个专门Agent分别负责环境配置、测试创建和问题描述合成,处理5,200个代码仓库的600万条Pull Request,生成包含10万条已验证软件工程实例的Scale SWE Data;作者称这是当时规模最大的此类数据集。该数据在仓库多样性上明显超过现有真实任务数据集,并反映实际任务的复杂度。进一步蒸馏71,498条高质量轨迹,微调Qwen30BA3BInstruct,得到ScaleSWE Agent。该Agent在SWE Bench Verified上的任务解决率为64,接近基础模型的三倍。ScaleSWE为软件工程大语言模型提供可扩展、可复现的数据构建方法,数据将向公众开放。

ScaleSWE 自动构建经验证的软件工程训练数据:用于构建Scale-SWE数据集的沙箱化多Agent系统。流水线从数百万个GitHub拉取请求出发,以一系列自主Agent把高质量PR转为可
图2:用于构建Scale-SWE数据集的沙箱化多Agent系统。流水线从数百万个GitHub拉取请求出发,以一系列自主Agent把高质量PR转为可执行的软件工程任务,自动完成环境配置、单元测试生成(Fail-to-Pass与Pass-to-Pass)和正式问题描述合成,以支持提炼轨迹的规模化与可复现性。