论文

调度和校准:实用程序引导的多任务强化学习代码 LLM

Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs

模型训练强化学习

摘要

具有可验证奖励的强化学习 (RL) 已被证明在 后训练 LLM 的编码方面是有效的,但部署单独的特定任务专家会产生随着任务数量而增加的成本,从而激发了统一的多任务 RL (MTRL) 方法。然而,现有的MTRL方法统一处理所有编码任务,依赖于共享优化策略下的固定数据课程,最终限制了多任务训练的有效性。为了解决这些限制,我们提出了 ASTOR,一种通过实用程序驱动的协调的多任务代码强化学习框架。以任务效用、捕获每个任务学习潜力和跨任务协同作用的信号为中心,ASTOR 包含两个耦合模块:1)分层效用路由数据调度模块分层分配训练预算并优先考虑信息提示,引导训练转向最有价值的数据;2)自适应效用校准策略优化模块动态扩展每个任务的 KL 正则化,将更新约束与每个任务当前的训练状态相匹配。在四个代表性编码任务中对两个广泛使用的 LLM 进行的实验表明,ASTOR 在所有任务中持续改进单个模型,比最佳特定任务专家的表现高 9.0%-9.5%,比最强的 MTRL 基线高 7.5%-12.8%。