论文
用于具有密集奖励的代码生成的领域适应性强化学习
Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards
摘要
大语言模型 显示出自动代码生成的强大潜力,但缺乏正确性、质量、安全性和特定领域约束的保证。例如,在机器人技术中,代码生成越来越多地用于规划和执行操作,因此对环境和物理约束的了解至关重要。为了促进代码生成 LLM 适应不同的需求,包括特定领域的需求,我们提出了一个强化学习框架,该框架使用近端策略优化来微调预训练的 LLM。我们可定制的执行感知奖励公式捕获并优化语法、功能正确性、代码风格、安全性和模拟器可执行性。 词元级 奖励映射机制可以实现从执行结果到生成词元的有效贡献分配。该框架在通用代码生成 (MBPP/MBPP+) 和机器人程序合成 (RoboEval) 上进行评估。结果显示,功能正确性和模拟器可执行性得到了显着改进,包括 MBPP 上的绝对 pass@1 增加了 19%,RoboEval 上的执行失败减少了 51%。这些发现表明,结构化强化学习可以有效地将语言模型调整到正确的程序生成和特定领域的要求。