论文
基于结构感知奖励的以规划器为中心的深度研究强化学习
Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward
摘要
深度研究任务要求LLM规划要调查什么、检索证据,并跨多个调查分支综合出长篇回答。现有训练范式要么依赖短式可验证问答作为替代,要么优化整体式的长轨迹,这使得规划与执行难以解耦,并对规划过程产生微弱的贡献归因。我们提出DecomposeR,一个以规划器为中心的深度研究框架,将研究计划表示为带类型的有向无环图(DAG),使规划得以显式化、结构化并可被奖励。我们分两阶段训练Qwen3-8B模型:规划器强化学习(RL)首先学习图结构与查询分解以改进研究规划,随后回答器强化学习(RL)在所学计划的条件下学习分支级执行与最终综合。通过将奖励分配给显式的规划器标记和结构化组件而非扁平轨迹,DecomposeR实现了对规划的更细粒度优化,同时降低了端到端训练的模糊性。实验表明,得益于规划与回答能力的提升,DecomposeR-8B在主流长篇基准上比强大的可比开源基线高出5.1-8.0分。
