论文
从自演化合成数据到可验证奖励RL:后训练多轮交互式工具使用智能体
From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents
摘要
交互式工具使用智能体必须通过与人类和外部环境的多轮交互解决真实世界任务,需要对话状态跟踪、多步工具执行,并遵守复杂指令。后训练此类智能体颇具挑战,因为高质量多轮工具使用数据的合成难以扩展,且强化学习(RL)可能因用户模拟产生噪声信号,导致训练效率下降。我们提出一个统一框架,结合自演化数据智能体与基于验证器的RL。我们的系统EigenData是一个分层多智能体引擎,它合成带工具支撑的对话以及可执行的逐实例检查器,并通过更新提示与工作流的闭环自演化过程提升生成可靠性。基于合成数据,我们开发了先微调用户模型、再施加GRPO式训练的RL配方,采用轨迹级组相对优势与动态过滤,带来超越SFT的持续改进。在tau^2-bench上评估,我们的最佳模型在Airline上达到73.0% pass^1,在Telecom上达到98.3% pass^1,匹敌或超越前沿模型。总体而言,我们的结果为无需昂贵人工标注即可引导复杂工具使用行为提供了一条可扩展路径。
