论文
ScaleSWE 自动构建经验证的软件工程训练数据
Immersion in the GitHub Universe: Scaling Coding Agents to Mastery
摘要
现实软件工程任务的能力提升,受到大规模高质量训练数据不足的根本限制。环境配置、单元测试生成和问题描述整理的复杂性,使数据规模难以扩大。我们提出ScaleSWE,一个在沙箱中运行的自动多Agent工作流,用于大规模构建高质量软件工程数据。三个专门Agent分别负责环境配置、测试创建和问题描述合成,处理5,200个代码仓库的600万条Pull Request,生成包含10万条已验证软件工程实例的Scale SWE Data;作者称这是当时规模最大的此类数据集。该数据在仓库多样性上明显超过现有真实任务数据集,并反映实际任务的复杂度。进一步蒸馏71,498条高质量轨迹,微调Qwen30BA3BInstruct,得到ScaleSWE Agent。该Agent在SWE Bench Verified上的任务解决率为64,接近基础模型的三倍。ScaleSWE为软件工程大语言模型提供可扩展、可复现的数据构建方法,数据将向公众开放。
