论文
RODS:面向多轮工具使用智能体的奖励驱动在线数据合成
RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents
摘要
多轮工具使用RL受静态数据集中有信息样本快速耗尽制约。我们观察到GRPO中的梯度信号集中于rollout奖励方差最高的任务——这是Popoviciu上界的后果。因此——处于智能体能力边界附近的样本(成败大致平衡处)贡献不成比例大的策略梯度。随训练推进——该边界持续移动——逐渐耗尽静态数据集中的有信息样本池。我们提出RODS(奖励驱动的在线数据合成)解决该耗尽。RODS闭合RL训练与数据生成间的回路——把进度奖励方差重新用作实用、零成本的能力边界检测器——除为训练已计算的rollout外无需额外推理。它持续识别此类边界样本——经技能对齐的重采样管线合成匹配其结构复杂度(如API拓扑与依赖深度)的新多轮变体——并管理与策略共同演化的动态回放缓冲。从400个人工种子出发、维持约800样本的活动训练池——RODS取得与1.7万样本离线管线可比的性能——所需轨迹少约20倍——并在受控设定中超越固定数据RL与环境增广。
