论文

面向工具调用智能体的多轮强化学习与迭代奖励校准

Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration

模型训练强化学习RLVRAgentic RL

摘要

由于结果奖励稀疏以及跨对话轮次的贡献归因困难,在多轮任务上用强化学习训练工具调用智能体仍然充满挑战。我们首次将MT-GRPO(Multi-Turn Group Relative Policy Optimization,多轮组相对策略优化)与GTPO(Generalized Token-level Policy Optimization,广义token级策略优化)结合,在基于LLM用户模拟器的真实客服任务上训练工具调用智能体。通过对训练rollout的系统分析,我们发现设计不当的密集逐轮奖励会因奖励区分度与优势方向之间的错位而使性能下降多达14个百分点。我们提出迭代奖励校准(Iterative Reward Calibration),一种利用rollout数据的经验判别性分析来设计逐轮奖励的方法,并证明我们的GTPO混合优势形式消除了优势错位问题。应用于Tau-Bench航空基准时,我们的方法将Qwen3.5-4B从63.8%提升到66.7%(+2.9个百分点),将Qwen3-30B-A3B从58.0%提升到69.5%(+11.5个百分点)——训练后的4B模型虽小50倍,仍超过GPT-4.1(49.4%)与GPT-4o(42.8%),而30.5B的MoE模型则逼近Claude Sonnet 4.5(70.0%)。据我们所知,这是已发表的Tau-Bench上首批RL训练结果。我们发布了代码、奖励校准分析与训练配方。