论文
RC-GRPO:面向多轮工具调用智能体的奖励条件组相对策略优化
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
摘要
多轮工具调用对大语言模型(LLM)具有挑战性,因为奖励稀疏且探索代价高昂。常见的先SFT再GRPO配方,在组内奖励变异较低时会停滞(例如,组内更多rollout获得全0或全1奖励),使组归一化优势失去信息量,导致更新消失。为解决该问题,我们提出RC-GRPO(Reward-Conditioned Group Relative Policy Optimization),它通过离散奖励token将探索视为一个可控的转向问题。我们首先在混合质量轨迹上微调奖励条件轨迹策略(Reward-Conditioned Trajectory Policy,RCTP),在提示中注入奖励目标特殊token(如<|high_reward|>、<|low_reward|>),使模型学会按需生成不同质量的轨迹;随后在RL阶段,我们在每个GRPO组内采样多样的奖励token,并以采样到的token为条件执行rollout,以提升组内多样性、改善优势增益。在Berkeley Function Calling Leaderboard v4(BFCLv4)多轮基准上,我们的方法相较基线取得持续的性能提升,且Qwen-2.5-7B-Instruct上的性能甚至超过所有闭源API模型。
