论文
基于子任务分解的强化学习
Reinforcement Learning with Decomposed Subtasks
摘要
组相对策略优化(GRPO)及相关的策略梯度方法在训练语言模型Agent时,会把整个多轮rollout在进入策略更新之前坍缩为一个标量轨迹奖励。当任务由不同技能组合而成、尤其在环境反馈稀疏且延迟的情况下,这种坍缩是有损的:优化器必须隐式推断是哪种能力驱动了结果、以及行为应当如何随之改变。我们认为正确的原语不是更好的标量,而是分解:轨迹奖励应在进入策略更新之前沿子任务拆分。我们提出基于子任务分解的强化学习(RLDS),其核心是子任务分解优势估计(SDAE):替代GRPO的标量优势,在固定分类体系上把轨迹奖励拆分为各子任务的份额,计算每个子任务的组相对优势,并按重要性对各子任务优势加权来分配每token的信用,将信用集中到反思标记该子任务执行产生关键影响的步骤附近。我们在四个Agentic基准上评测:FrozenLake(稀疏网格导航)、HotpotQA(多跳问答,一个检索工具)、ScienceWorld(长程具身科学)与DeepResearch(长篇研究,四个工具,复合评分准则奖励)。训练期间输出的异质性诊断显示了分解在哪里有回报:增益随子任务异质性扩展,在高异质任务ScienceWorld上最大(+11.5分,配对自助法95%置信区间[+9.8, +13.3])与FrozenLake(+9.8分,[+7.0, +12.8]),而在HotpotQA与DeepResearch上处于噪声范围内——诊断也预测了这两项几乎没有可回收空间。在ScienceWorld上,RLDS还比标量GRPO更省算力(每步墙钟时间-10.9%),因为长rollout摊薄了固定的反思与评分开销。
