论文

RODS:面向多轮工具使用智能体的奖励驱动在线数据合成

RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents

模型训练强化学习合成数据RLVRAgentic RL

摘要

多轮工具使用RL受静态数据集中有信息样本快速耗尽制约。我们观察到GRPO中的梯度信号集中于rollout奖励方差最高的任务——这是Popoviciu上界的后果。因此——处于智能体能力边界附近的样本(成败大致平衡处)贡献不成比例大的策略梯度。随训练推进——该边界持续移动——逐渐耗尽静态数据集中的有信息样本池。我们提出RODS(奖励驱动的在线数据合成)解决该耗尽。RODS闭合RL训练与数据生成间的回路——把进度奖励方差重新用作实用、零成本的能力边界检测器——除为训练已计算的rollout外无需额外推理。它持续识别此类边界样本——经技能对齐的重采样管线合成匹配其结构复杂度(如API拓扑与依赖深度)的新多轮变体——并管理与策略共同演化的动态回放缓冲。从400个人工种子出发、维持约800样本的活动训练池——RODS取得与1.7万样本离线管线可比的性能——所需轨迹少约20倍——并在受控设定中超越固定数据RL与环境增广。

RODS:面向多轮工具使用智能体的奖励驱动在线数据合成:论文配图
图 1:静态数据训练与 RODS 动态合成范例的当前局限性。 (a) 数据稀缺 (ℂ​1\mathbb{C}1):高质量的多轮工具使用数据集需要大量的人工注释工作。 (b) 能力与静态数据 (ℂ​2\mathbb{C}2):随着模型学习,静态数据被掌握,导致梯度信号丢失。 (c) 语义脱节 (ℂ​3\mathbb{C}3):简单地拼接单轮查询会产生脱节的交互。 (d) RODS 解决方案:闭环数据引擎不断摄取静态数据以检测不断变化的能力边界,在模型需要的地方合成连贯的、有针对性的活动语料库。