论文

SynPlanResearch-R1:用合成计划鼓励深度研究中的工具探索

SynPlanResearch-R1: Encouraging Tool Exploration for Deep Research with Synthetic Plans

模型训练强化学习合成数据RLVRAgentic RL

摘要

研究型智能体(Research Agents)使模型能够借助工具从网络收集信息以回答用户查询,要求其动态地交替进行内部推理与工具使用。尽管这类能力原则上可以通过可验证奖励强化学习(RLVR)习得,我们观察到智能体常表现出糟糕的探索行为,包括过早终止与有偏的工具使用。因此,仅靠RLVR带来的改进有限。我们提出SynPlanResearch-R1,该框架合成鼓励更深入探索的工具使用轨迹,在冷启动监督微调阶段塑造探索行为,为后续强化学习提供强初始化。在七个多跳与开放网络基准上,与SOTA基线相比,SynPlanResearch-R1在Qwen3-8B与Qwen3-4B骨干上分别带来最高6.0%与5.8%的性能提升。与基线相比,对工具使用模式与训练动态的进一步分析揭示了这些增益背后的因素。我们的代码已公开于 https://github.com/HansiZeng/syn-plan-research。