论文

通过强化学习快速优化 LLM 代码生成

Prompt Optimization for LLM Code Generation via Reinforcement Learning

上下文与知识上下文工程

摘要

大语言模型(LLM)可以从自然语言生成代码,但其性能对提示表述高度敏感。我们提出了一个基于强化学习的框架,将即时细化建模为顺序决策问题。近端策略优化 (PPO) 代理使用混合动作空间迭代地改进提示,该混合动作空间结合了直接生成、遗传词汇突变和语义重写,并以单元测试反馈得出的形状奖励为指导。我们使用 CodeT5+、CodeLLaMA 和 DeepSeek-Coder 作为冻结代码生成器在 MBPP+、HumanEval+ 和 APPS 上评估框架。在 500 任务 MBPP+ 测试集上,PPO 智能体的严格 Pass@1 分数分别为 57.58%、64.80% 和 85.50%,优于 EPiC、Reflexion 和 Random-Hybrid。 Soft-Pass@1 分别达到 67.90%、73.10% 和 88.20%。在所有骨干模型的 HumanEval+ 和 APPS 上都观察到了类似的改进。结果表明,具有成型测试驱动奖励的强化学习提高了基于 LLM 的代码生成的功能正确性。