论文

Qwen3-Coder-Next技术报告:用可验证编程任务训练编码Agent

Qwen3-Coder-Next Technical Report

模型训练智能体系统强化学习合成数据Agent HarnessRLVRAgentic RLAgent Runtime

摘要

报告介绍面向编码Agent的开放权重模型Qwen3-Coder-Next,重点讨论可验证任务和可执行环境如何支撑训练。模型总参数为800亿,每次推理激活约30亿参数。 训练通过合成编程任务、软件环境和测试反馈,覆盖代码修改、工具使用及运行结果;报告在SWE-Bench、Terminal-Bench等基准上评估模型。本文是模型发布后的技术报告,按论文首次提交时间独立归属,不能把报告中的后续信息回填到2月模型首发事件。

图2:通过合成代码缺陷扩展软件工程训练任务的流程。
Figure 2: Our pipeline for synthesizing bugs to scale up the number of software engineering tasks.