论文

CoRe-Code:面向代码生成的协同强化学习

CoRe-Code: Collaborative Reinforcement Learning for Code Generation

模型训练强化学习RLVR

摘要

大语言模型(LLM)在代码生成上表现强劲,但大多数方法依赖没有全局规划的自回归解码,常导致局部连贯但全局欠佳的解(例如测试用例失败或复杂度低效)。尽管思维链(Chain-of-Thought,CoT)与多智能体系统(MAS)等近期方法引入了规划,但其有限的角色专业化与协调阻碍了在复杂任务上的表现。为解决多智能体代码生成中的协调与专业化难题,我们提出协同强化代码(Collaborative Reinforcement Code,CoRe-Code),一个角色专业化LLM智能体框架,增强智能体间协调以生成更准确、更高效的代码。CoRe-Code采用简单的Planner-Coder范式:Planner产出高层计划,Coder执行计划生成代码。我们进一步引入基于组相对策略优化(GRPO)的协作感知强化学习阶段,以增强角色专业化与对齐。实验表明CoRe-Code超越广泛的现有基于RL的方法与多智能体方法。此外,我们证明CoRe-Code可泛化到其他多智能体框架(例如检索与调试智能体),凸显其灵活性与可扩展性。我们使用三个基座模型在多个不同难度的基准上评估CoRe-Code。与现有基线相比,结果显示准确率持续提升,同时在执行时间与内存使用上效率更高,展示了CoRe-Code的有效性与实用性。

CoRe-Code:面向代码生成的协同强化学习:论文配图
图2:CoRe-Code概览:Planner智能体优化算法思路生成,Coder智能体负责将思路转化为正确高效的代码实现。