论文

基于结构感知奖励的以规划器为中心的深度研究强化学习

Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward

模型训练强化学习

摘要

深度研究任务要求LLM规划要调查什么、检索证据,并跨多个调查分支综合出长篇回答。现有训练范式要么依赖短式可验证问答作为替代,要么优化整体式的长轨迹,这使得规划与执行难以解耦,并对规划过程产生微弱的贡献归因。我们提出DecomposeR,一个以规划器为中心的深度研究框架,将研究计划表示为带类型的有向无环图(DAG),使规划得以显式化、结构化并可被奖励。我们分两阶段训练Qwen3-8B模型:规划器强化学习(RL)首先学习图结构与查询分解以改进研究规划,随后回答器强化学习(RL)在所学计划的条件下学习分支级执行与最终综合。通过将奖励分配给显式的规划器标记和结构化组件而非扁平轨迹,DecomposeR实现了对规划的更细粒度优化,同时降低了端到端训练的模糊性。实验表明,得益于规划与回答能力的提升,DecomposeR-8B在主流长篇基准上比强大的可比开源基线高出5.1-8.0分。

基于结构感知奖励的以规划器为中心的深度研究强化学习:论文配图
图1:DecomposeR rollout结构:规划器生成类型化DAG并依检索结果修订图与抓取集,应答器按拓扑波次执行图后撰写最终答案。