论文

指导 Qwen3 Coder 30B 像 CodeClash Arena 特工一样思考

Coaching Qwen3 Coder 30B to Think Like a CodeClash Arena Agent

模型训练监督微调与指令调优

摘要

大型语言模型编码代理最近对于软件任务变得有用,但较弱或开放权重代理仍然难以可靠地解释用户意图并执行复杂的多步骤工作流程。这种差距在长期设置中尤其明显,其中代理必须反复检查先前的结果、诊断故障并在交互约束下选择下一个代码编辑。它引发了一个自然的问题:我们可以做些什么来改进弱代码代理的思维过程?我们在 CodeClash 中研究了这个问题,CodeClash 是一个代码竞技场基准测试,其中原始工作通过多轮锦标赛评估了 6 个竞技场中的 8 个商业编码代理。由于 Qwen3 Coder Plus 在其中排名最后,因此我们以开放权重 Qwen3-Coder-30B 作为案例研究,并研究如何利用来自更强大代理的提炼知识来改进它。我们的分析表明,Qwen3-Coder-30B 对于竞技场式交互没有很好地优化:它经常产生语法和协议破坏错误,并且在各轮中表现出较弱的策略适应。这些故障很难仅通过普通指令调整来纠正,因为离线 SFT 无法直接验证生成的操作是否有效或有益。为了解决这个问题,我们提出了 ReAct SFT,它将教师轨迹重写为明确的 [obs][thought][act] 链,以及轨迹质量加权 SFT,它重新加权样本以鼓励编辑后检查。 ReAct SFT 极大地改善了策略行为,并且我们的微调模型在锦标赛评估中优于原始的 Qwen3 Coder Plus。