论文

通过强化学习和基于执行的可验证监督引导利基多语言代码翻译

Bootstrapping Niche Multilingual Code Translation via Reinforcement Learning with Execution-Based Verifiable Supervision

模型训练强化学习

摘要

代码翻译必须保留多种编程语言的可执行行为,但神经代码翻译主要集中在 C++、Java 和 Python 等一些流行语言上。这就留下了一个利基、多对多的环境,其中并行监督稀疏,产生看似合理但不可执行的翻译。我们通过基于执行的监督驱动的基于偏好的强化学习来解决这个问题。我们的管道首先将可验证的种子 Python 程序扩展为经过执行验证的多语言代码池。使用该池,基础 LLM 生成跨语言对的翻译候选,我们通过它们的执行结果来标记它们。由此产生的偏好用于训练对跨语言翻译质量进行评分的奖励模型。最后,我们使用奖励模型作为信号,使用超过 600 个定向语言对 (25 x 24) 的 GRPO 优化我们的基础 LLM。为了评估利基翻译能力,我们引入了 HumanEval-X++,这是一个基于执行的基准测试,它将 HumanEval-X 扩展到广泛的多对多语言空间。我们使用 Qwen-3.5 4B 和 9B 模型评估我们的方法。在 HumanEval-X++ 和现有基准上,它比未经训练的基准产生了一致的增益。特别是,4B 模型在 HumanEval-X++ 上的所有语言上平均提高了 13%,在中间层语言上提高了 21%。我们的研究建立了一种可靠的数据生成、训练和基准测试方法,为进一步提高编程语言多对多翻译的质量铺平了道路。