论文
当仿真说谎时:面向工具使用智能体的Sim-to-Real基准与域随机化RL配方
When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents
摘要
工具使用语言智能体通常在假设输入干净、工具注册表无歧义、API可靠的基准上评估。真实部署却违背所有这些假设:用户的拼写错误会传播成幻觉出的工具名,一个配置不当的请求超时可能让智能体无限停滞,跨服务器重复的工具名可能冻结整个SDK。我们将这些失败视为工具使用部分可观测马尔可夫决策过程(POMDP)中的sim-to-real差距,部署噪声通过观测、动作空间、与奖励相关的元数据或转移动力学进入。我们提出RobustBench-TC,一个包含22种扰动类型的基准,按这四个POMDP组件组织,每种扰动都基于经过核实的GitHub issue或有记录的工具调用失败。在从1.5B到32B参数的21个模型(包括闭源的o4-mini)上,鲁棒性表现极不均衡:观测扰动使准确率下降不到5%,而与奖励相关的扰动和转移扰动分别使准确率下降约40%和30%;仅靠扩大规模无法弥合这些差距。随后我们提出ToolRL-DR,一种域随机化强化学习(RL)配方,在覆盖三个可静态编码POMDP组件的扰动增强轨迹上训练工具使用智能体。在3B骨干上,ToolRL-DR-Full保留了约四分之三的干净准确率,总体扰动准确率与开源14B函数调用基线相当,并大幅缩小了与o4-mini的差距。尽管训练中从未见过转移扰动,它仍弥合了约27%的转移差距,这表明在对抗性静态工具使用输入上做RL能诱导出更持久的重试策略,并迁移到未见过的运行时故障。数据集、代码和基准排行榜已公开。
