论文
ToolPRMBench:评估与推进面向工具使用智能体的过程奖励模型
ToolPRMBench: Evaluating and Advancing Process Reward Models for Tool-using Agents
摘要
奖励引导的搜索方法通过有效引导在复杂动作空间上的采样与探索,展现出增强工具使用智能体的强大潜力。作为核心设计,这些搜索方法利用过程奖励模型(PRM)提供步骤级奖励,实现更细粒度的监控。然而,工具使用场景中缺乏针对 PRM 的系统、可靠评估基准。本文提出 ToolPRMBench,一个专为评估工具使用智能体的 PRM 设计的大规模基准。ToolPRMBench 构建在多个代表性工具使用基准之上,将智能体轨迹转换为步骤级测试用例。每个用例包含交互历史、一个正确动作、一个貌似合理但错误的替代动作以及相关工具元数据。我们分别利用离线采样隔离局部单步错误,利用在线采样从完整智能体 rollout 中捕捉现实的多步失败。我们提出多 LLM 验证流水线以降低标签噪声并确保数据质量。我们在 ToolPRMBench 上对大语言模型、通用 PRM 与工具专用 PRM 进行了大量实验。结果揭示了 PRM 有效性的明显差异,并凸显了工具专用 PRM 的潜力。代码与数据将发布于 https://github.com/David-Li0406/ToolPRMBench。
