论文

DecompRL:通过学习模块化代码生成解决更困难的问题

DecompRL: Solving Harder Problems by Learning Modular Code Generation

模型训练强化学习

摘要

大语言模型(LLM)如何解决他们目前无法解决的问题?重复采样可扩展测试时计算,但 GPU 成本会随着尝试的进行而线性增长,而具有可验证奖励的强化学习 (RL) 会以牺牲样本多样性为代价提高单次尝试的准确性。当基本策略产生正确解决方案的概率接近于零时,这两种策略最终都会失败:没有数量的采样或梯度信号可以克服太大的搜索空间。我们采取了不同的方法:我们不是更加努力地采样,而是通过将问题分解为更小的、可独立解决的子函数(其实现可以重新组合)来使任务变得更容易。由于现成的模型没有针对这种模块化生成进行训练,因此我们引入了 DecompRL,这是一种 RL 算法,可以显式地学习分解和实现分层代码结构。重新组合 $n$ 模块的 $k$ 实现可产生多达 $k^{n}$ 候选解决方案,将瓶颈从 GPU 推理转移到廉价的 CPU 评估,并将 GPU 词元成本削减 $\sim$50$\times$。在 LiveCodeBench 和 CodeContests(Qwen~2.5~7B,Code World Model~32B)上,DecompRL 的性能优于标准和多样性优化的 RL 基线,每个问题超过 10^5$ 词元,解决了标准生成无法达到的问题。