论文
通过需求感知课程强化学习改进 LLM 代码生成
Improving LLM Code Generation via Requirement-Aware Curriculum Reinforcement Learning
摘要
代码生成旨在根据给定的编程要求自动生成源代码,有可能大幅提高软件开发效率。随着大语言模型(LLM)的快速发展,基于LLM的代码生成引起了学术界和工业界的广泛关注。然而,随着编程要求变得越来越复杂,现有的 LLM 仍然表现出明显的性能限制。为了应对这一挑战,最近的研究提出了基于训练的课程强化学习(CRL)策略来提高 LLM 代码生成性能。尽管有效,现有的 CRL 方法仍存在一些局限性,包括要求难度感知不一致、缺乏要求难度优化以及课程抽样策略不理想。在基于 CRL 的代码生成中,编程要求作为模型的唯一输入,使其质量和难度对训练效果至关重要。受软件需求工程见解的启发,我们提出了 RECRL,这是一种新颖的需求感知课程强化学习框架,用于增强基于 LLM 的代码生成。 RECRL 自动感知特定于模型的需求难度,优化具有挑战性的需求以提高训练数据利用率,并采用自适应课程采样策略来构建难度平滑变化的训练批次。通过与五个最先进的基线进行比较,在五个广泛使用的代码生成基准上对五个最先进的 LLM 进行了广泛的实验,证明了 RECRL 的显着有效性。例如,RECRL 比所有最先进的基线平均 Pass@1 提高了 1.23%-5.62%。