论文
UnifiedPlayers:规划、执行与验证协作的工具推理强化学习
UnifiedPlayers: Enhance Tool-Integrated Reasoning in Agentic Reinforcement Learning
摘要
自演化方法允许使用工具的智能体生成自己的训练数据,减少人工标注轨迹需求。但现有方法通常把轨迹生成与评估分开,依赖无法适应新失败模式的静态验证器,或可能强化多条轨迹共有错误的自一致性信号。联合适应规划、执行和评估是有前景的替代方案,却带来协调挑战:每个组件持续改变其他组件用于训练的数据或反馈。我们以UnifiedPlayers应对这一挑战。该协作框架包含生成任务的规划角色、产生带Python工具调用的多轮轨迹的执行角色,以及构建可执行验证器的评估角色。我们设计角色专属奖励,在GRPO下协调三者朝共同学习目标推进。在两个模型骨干和十二个推理基准上,UnifiedPlayers相对最强既有基线,在数学推理和通用推理任务上分别至少提高3.5%和3.9%。学习到的验证器还达到84.2%的对抗检测准确率,其奖励信号逐题方差是自一致性基线的2.03倍,提供了更有区分度的验证。这些结果表明,专业化角色间协作是工具集成智能体自我增强的一条有前景路径。
