论文
CodeAlchemy:大规模综合代码重写
CodeAlchemy: Synthetic Code Rewriting at Scale
摘要
原始代码上的 预训练 教授语法,但为各种实际任务格式提供稀疏信号。虽然合成数据已被证明对语言模型具有变革性,但除了有限的质量改进之外,代码在很大程度上仍未得到探索。我们提出了 CodeAlchemy,一个合成数据生成框架,它通过 5 种策略将公开来源的代码转换为语义丰富的训练数据:CodeEnhance(质量感知重写)、CodeQA(基于模板的问题)、CodeDev(开发人员任务)、CodeDialogue(多轮对话)和 CodeTrace(执行跟踪)。我们处理 15 种语言的 3 个语料库,生成 500B+ 合成数据标记以及 350B 推理标记,比之前的工作高出几个数量级。 CodeTrace 检测并执行 14 种语言和 5K 库的 130 万多个文件,捕获控制流、状态跟踪和库知识。我们引入DevEval(开发者任务)和TraceEval(执行预测)基准;像 Claude Sonnet 4.5 这样的前沿模型在 TraceEval 上仅实现 5.6% 的精确匹配,揭示了语义理解方面的关键差距。我们的 3B 模型在 HumanEval 上达到 83.5%,在 MBPP 上达到 63.2%,在 DevEval 上达到 8.09% 胜率,在 TraceEval 上达到 15.36 ROUGE-2,性能优于前沿模型 10 倍,包括 27B Gemma-3 和 32B Granite-4.0。