论文

PivotRL:低算力成本下的高精度智能体后训练

PivotRL: High Accuracy Agentic Post-Training at Low Compute Cost

模型训练强化学习Agentic RL

摘要

面向长时程智能体任务的后训练在计算效率与泛化之间存在张力。监督微调(SFT)计算高效,但常出现域外(OOD)性能退化。相反,端到端强化学习(E2E RL)能保持OOD能力,却因多轮on-policy rollout而产生高昂计算成本。我们提出PivotRL,一个在既有SFT轨迹上运行的新框架,将SFT的计算效率与E2E RL的OOD精度结合起来。PivotRL依赖两个关键机制:其一,执行局部on-policy rollout并筛选出pivot——即采样动作在结果上方差很大的信息量丰富的中间轮次;其二,对功能等价的动作给予奖励,而不是要求与SFT数据示范严格字符串匹配。我们从理论上证明,这些机制能激励具有高自然梯度范数的强学习信号,同时最大程度保持策略在与训练任务无关的动作上的概率排序。在相同数据上与标准SFT相比,我们证明PivotRL在四个智能体领域的域内精度平均高出+4.17%,在非智能体任务上OOD精度高出+10.04%。值得注意的是,在智能体编程任务上,PivotRL以少4倍的rollout轮数达到与E2E RL相当的精度。PivotRL已被NVIDIA的Nemotron-3-Super-120B-A12B采用,作为生产级智能体后训练的主力方法。

PivotRL:低算力成本下的高精度智能体后训练:论文配图
图 1:使用相同数量的计算节点,SWE-Bench 准确度与训练期间的 (a) 累积推出轮数和 (b) 累积推出时间对比。 PivotRL 达到了与 E2E RL 相当的精度,并且滚动次数减少了约 4×{\sim}4\ 倍,挂钟时间减少了约 5.5×{\sim}5.5\ 倍。