论文
函数感知填空作为编码智能体基础模型的中期训练
Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models
摘要
编码智能体必须把外部工具返回值整合进进行中的推理——标准从左到右的代码预训练只在前向方向暴露该能力。我们观察到编码智能体的“动作—观察—继续”循环与函数调用点结构同构:调用者绑定参数、被调者返回在别处计算的值、下游代码消费该值。这种条件化结构在互联网规模的普通代码中普遍存在。我们经函数感知填空(FIM)中期训练利用它:一个自监督目标——经程序依赖图分析与复杂度—可推断性双重准则选择被掩码的函数。我们在取自968个GitHub仓库的26亿token去污染语料上中期训练Qwen2.5-Coder-Instruct(7B/14B)与Qwen3-8B,随后应用既有的智能体后训练管线。中期训练把SWE-Bench-Verified提升+2.8/+3.0(7B/14B)与+3.2(Qwen3-8B);SWE-Bench-Lite在同批模型上增益+3.7/+4.0/+5.4。改进跨两条后训练管线(R2E-Gym、SWE-Smith)与非Qwen2.5基座(配SWE-Lego的Qwen3-8B)成立。除域内增益外,中期训练还缓解智能体后训练对非智能体编码(如LiveCodeBench)与非编码工具使用基准(tau-bench、BFCL)的能力侵蚀:尽管中期训练语料只含Python代码,函数调用归纳偏要在后训练后存活并产生一致增益。