论文

UnifiedPlayers:规划、执行与验证协作的工具推理强化学习

UnifiedPlayers: Enhance Tool-Integrated Reasoning in Agentic Reinforcement Learning

模型训练强化学习RLVRAgentic RL

摘要

自演化方法允许使用工具的智能体生成自己的训练数据,减少人工标注轨迹需求。但现有方法通常把轨迹生成与评估分开,依赖无法适应新失败模式的静态验证器,或可能强化多条轨迹共有错误的自一致性信号。联合适应规划、执行和评估是有前景的替代方案,却带来协调挑战:每个组件持续改变其他组件用于训练的数据或反馈。我们以UnifiedPlayers应对这一挑战。该协作框架包含生成任务的规划角色、产生带Python工具调用的多轮轨迹的执行角色,以及构建可执行验证器的评估角色。我们设计角色专属奖励,在GRPO下协调三者朝共同学习目标推进。在两个模型骨干和十二个推理基准上,UnifiedPlayers相对最强既有基线,在数学推理和通用推理任务上分别至少提高3.5%和3.9%。学习到的验证器还达到84.2%的对抗检测准确率,其奖励信号逐题方差是自一致性基线的2.03倍,提供了更有区分度的验证。这些结果表明,专业化角色间协作是工具集成智能体自我增强的一条有前景路径。

UnifiedPlayers:规划、执行与验证协作的工具推理强化学习:论文配图
图4:UnifiedPlayers代表性输出。(a)规划角色在三轮外部迭代中生成更难任务。(b)独立留出的MATH-500样例中,执行角色推理带数字约束的倍数,调用Python并返回2220。(c)评估角色编写可执行验证器,接受原轨迹,拒绝将2220改为2200的参数变异版本。