论文

性能、效率与崩溃——Code LLM离线后训练的优势与挑战

Performance, Efficiency and Collapse -- Advantages and Challenges in Offline Post-training of Code LLMs

模型训练强化学习

摘要

强化学习 (RL) 后训练是代码生成大型语言模型 (LLM) 开发的关键阶段,因为它确保遵守指令并生成功能正确的代码。此过程通常需要从基于 Transformer 的 LLM 生成计算密集型代码样本,以及用于序列验证的大量 GPU-CPU 通信。为了解决这些计算挑战,这项工作研究了是否可以通过利用现有数据集而不是生成新样本来完全离线执行基于强化学习的后训练。研究结果表明,只需几个小时的训练,LLM 的零样本代码生成性能就可以在无需在线采样的情况下得到显着提高。此外,离线强化学习在 0.5B 到 7B 参数范围内的模型中产生了性能提升,尽管改进的程度因模型系列而异。