论文

RC-GRPO:面向多轮工具调用智能体的奖励条件组相对策略优化

RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents

模型训练强化学习RLVRAgentic RL

摘要

多轮工具调用对大语言模型(LLM)具有挑战性,因为奖励稀疏且探索代价高昂。常见的先SFT再GRPO配方,在组内奖励变异较低时会停滞(例如,组内更多rollout获得全0或全1奖励),使组归一化优势失去信息量,导致更新消失。为解决该问题,我们提出RC-GRPO(Reward-Conditioned Group Relative Policy Optimization),它通过离散奖励token将探索视为一个可控的转向问题。我们首先在混合质量轨迹上微调奖励条件轨迹策略(Reward-Conditioned Trajectory Policy,RCTP),在提示中注入奖励目标特殊token(如<|high_reward|>、<|low_reward|>),使模型学会按需生成不同质量的轨迹;随后在RL阶段,我们在每个GRPO组内采样多样的奖励token,并以采样到的token为条件执行rollout,以提升组内多样性、改善优势增益。在Berkeley Function Calling Leaderboard v4(BFCLv4)多轮基准上,我们的方法相较基线取得持续的性能提升,且Qwen-2.5-7B-Instruct上的性能甚至超过所有闭源API模型。

RC-GRPO:面向多轮工具调用智能体的奖励条件组相对策略优化
图1:RC-GRPO 概览。(上)从 SFT 初始化出发的标准 GRPO 优化会大幅降低 rollout 多样性,导致组内奖励方差很低、优势信号微弱甚至消失。(下)我们的 RC-GRPO 以离散奖励 token 为条件生成 rollout,并在每个组内采样多样化的 token,显式注入方差并产生有信息量的优势。