论文

从 SWE-ZERO 到 SWE-HERO:软件工程代理的免执行到基于执行的 微调

From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents

模型训练监督微调与指令调优

摘要

我们将 SWE-ZERO 引入 SWE-HERO,这是一种两阶段 SFT 配方,通过蒸馏开放权重前沿 LLM,在 SWE 工作台上实现了最先进的结果。我们的管道用进化细化策略取代了资源密集型依赖关系:(1) SWE-ZERO 利用大规模、免执行轨迹来掌握代码语义和存储库级推理,(2) SWE-HERO 应用有针对性的、执行支持的细化将这些语义直觉转变为严格的工程工作流程。我们的实证结果为同等规模的开源模型树立了新的基准。我们发布了从 Qwen3-Coder-480B 中提取的 300k SWE-ZERO 和 13k SWE-HERO 轨迹数据集,以及一套基于 Qwen2.5-Coder 系列的代理。值得注意的是,SWE-HERO-32B 在 SWE-bench Verified 上实现了 62.2% 的分辨率。此外,尽管仅接受了 Python 培训,但我们的代理在 SWE-bench Multilingual 上展示了强大的零样本可迁移性,达到 44.1%,并证实了该范式在不同语言中的通用性。