论文

ToolRACER:面向智能体训练与评测的稳健对话模拟资源

ToolRACER: A Robust Agentic Conversation Emulation Resource for Agent Training and Evaluation

模型训练智能体系统模型评测合成数据Agent任务评测鲁棒性、公平性与可信度评测

摘要

面向任务的会话Agent在现实世界的会话场景中仍然脆弱,因为它们很少遵循可预测的脚本,特别是当用户表现出不合作行为时。现有的函数调用基准通常强调成功的合作交互,而低估了对抗性对话轨迹,从而限制了可用于开发强大Agent的培训资源。我们提出了 ToolRACER,这是一种合成数据生成管道,可协调用户、助手和工具仿真模型,以生成并验证用户和Agent之间的多轮交互。使用 \sysn,我们构建了 ToolRACERBench 一个强大的多回合对话基准,涵盖六个领域,涵盖超过 55 个不同的角色,生成经过验证的 5.6K 对话轨迹语料库,其中大约 66% 的对话包含容易失败的对话场景。我们注入对抗性行为,生成经过验证的对话交互轨迹,捕捉真实、稳健的场景。我们根据内部基准以及函数调用基准(例如 $τ^2$-bench、BFCLv3 和 ACEBench)评估在 ToolRACERBench 上训练的模型,以评估 Agentic 的准确性和鲁棒性。在 ToolRACERBench 上训练的模型提高了 $τ^2$-bench 和 ACEBench 上的端到端 Agentic 准确性,证明了与小语言模型中的域内数据集混合用于Agent能力任务时的显着收益。

ToolRACER:面向智能体训练与评测的稳健对话模拟资源:论文原图
图 2:用于稳健数据生成的 ToolRACER 概述。场景规范规定了用户、助手和工具代理之间的交互,助手选择通过工具调用进行操作或以自然语言进行响应。四名评委评估语法错误、忠实度、角色混乱和任务成功。经过验证的对话保留在数据集中,而失败原因则作为修复和重新模拟不成功对话的纠正提示。在最大尝试次数后仍然无效的案例将被丢弃。