论文

基于子任务分解的强化学习

Reinforcement Learning with Decomposed Subtasks

模型训练强化学习RLVRAgentic RL

摘要

组相对策略优化(GRPO)及相关的策略梯度方法在训练语言模型Agent时,会把整个多轮rollout在进入策略更新之前坍缩为一个标量轨迹奖励。当任务由不同技能组合而成、尤其在环境反馈稀疏且延迟的情况下,这种坍缩是有损的:优化器必须隐式推断是哪种能力驱动了结果、以及行为应当如何随之改变。我们认为正确的原语不是更好的标量,而是分解:轨迹奖励应在进入策略更新之前沿子任务拆分。我们提出基于子任务分解的强化学习(RLDS),其核心是子任务分解优势估计(SDAE):替代GRPO的标量优势,在固定分类体系上把轨迹奖励拆分为各子任务的份额,计算每个子任务的组相对优势,并按重要性对各子任务优势加权来分配每token的信用,将信用集中到反思标记该子任务执行产生关键影响的步骤附近。我们在四个Agentic基准上评测:FrozenLake(稀疏网格导航)、HotpotQA(多跳问答,一个检索工具)、ScienceWorld(长程具身科学)与DeepResearch(长篇研究,四个工具,复合评分准则奖励)。训练期间输出的异质性诊断显示了分解在哪里有回报:增益随子任务异质性扩展,在高异质任务ScienceWorld上最大(+11.5分,配对自助法95%置信区间[+9.8, +13.3])与FrozenLake(+9.8分,[+7.0, +12.8]),而在HotpotQA与DeepResearch上处于噪声范围内——诊断也预测了这两项几乎没有可回收空间。在ScienceWorld上,RLDS还比标量GRPO更省算力(每步墙钟时间-10.9%),因为长rollout摊薄了固定的反思与评分开销。

基于子任务分解的强化学习:论文配图
图1:单次 rollout 的 SDAE 示意,其中 G=2、K=2、R=1。环境奖励 R 被分配到策略模型给出的子任务评分 g_{i,k},再通过以关键点 pivot_{i,k} 为中心的高斯核归因到 Token,得到最终逐 Token 优势 Â_{i,t}。红、绿色深浅表示奖励、子任务评分和逐 Token 优势的相对大小。