论文

DHRCL:密集分级奖励和课程学习的训练代码 LLM

DHRCL:Training Code LLMs with Dense Hierarchical Rewards and Curriculum Learning

模型训练强化学习

摘要

强化学习是面向代码的 大语言模型 的自然 后训练 范式,因为生成的程序可以通过解析、执行、单元测试和结构分析进行评估。然而,现有方法通常依赖于稀疏结果奖励或静态组合异构密集信号,即使语法有效性、可执行性、功能正确性和结构组织描述了不同且逐渐依赖的编程能力。我们提出了 DHRCL,一种具有密集层次奖励和课程学习的强化学习框架。 DHRCL 将反馈分解为语法验证、执行成功、单元测试通过率和基于 AST 的结构相似性,并通过三阶段语法、执行、通过和结构课程来组织这些信号。阶段持续时间是根据最近的验证趋势自动确定的,而不是手动指定的能力阈值。我们进一步引入阶段感知的基于概率的词元信用重新分配。该机制遵循从整合到细化的原则:它强调在面向语法的优化过程中已建立的词元模式,对非本地执行反馈应用统一传播,并在最终功能优化过程中将更多的功劳或责任分配给尚未建立的词元决策。在统一的 Qwen3-8B 和 KodCode 协议下,实验将 DHRCL 与二进制、通过率、基于奖励模型和可验证的密集奖励基线进行比较。我们进一步评估了 Qwen3-4B、Qwen3-8B 和 Qwen3-14B 主干网的 DHRCL,表明随着模型容量的增加,其优势保持一致。