论文

选择性左移:将测试时计算和基于难度的管理转化为低资源代码生成的训练数据

Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation

模型训练合成数据

摘要

大语言模型 为 Python 和 Java 等高资源语言实现了强大的代码生成,但在 Julia 等低资源编程语言 (LRPL) 上性能急剧下降。改进这些语言的小语言模型~(SLM)面临着三难:有监督的 微调~(SFT)因数据稀缺而成为瓶颈,推理时间扩展对于部署来说成本太高,而从头开始强化学习产生的优势几乎为零。我们提出了一个三相管道,通过将语法获取与算法推理解耦来解决这个三难困境。首先,我们对离线数据合成引擎进行\emph{left-shift}推理时间计算,该引擎使用迭代编译器和测试反馈来生成经过验证的训练示例。其次,我们在这个合成的、经过验证的数据上微调 SLM,以嵌入强大的句法先验。第三,我们应用基于与语言无关的输入/输出测试的可验证奖励的强化学习(RLVR),其中 SFT 先验限制了对语法错误的探索。应用于 Qwen3-8B 时,与 SOTA 结果相比,我们的流程在 MultiPL-E 上将 pass@1 提高了 7.6 点,在 Agnostics LiveCodeBench for Julia 上提高了 14.2 点。此外,与之前最先进的技术相比,该管道仅使用 $\frac{1}{3}$ 数据和 $\frac{1}{6}$ 成本。我们进一步证明,该管道可推广到 Ballerina,达到 49.7% MultiPL-E Pass@1,这是一种预训练表示接近于零的语言。消融证实,SFT 阶段和基于执行的奖励对于稳定的训练都是必要的。