论文
AgentProcessBench:诊断工具使用型智能体的步骤级过程质量
AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents
摘要
尽管大语言模型(LLM)已演化为工具使用型智能体,它们在长程交互中依然脆弱。与数学推理中错误往往可通过回溯加以纠正不同,工具使用失败常常引发不可逆的副作用,使得准确的步骤级验证至关重要。然而,现有的过程级基准大多局限于封闭世界的数学领域,无法捕捉工具执行的动态性与开放性。为弥合这一空白,我们提出AgentProcessBench,这是首个专门评估真实工具增强轨迹中步骤级有效性的基准。该基准包含1,000条多样化轨迹和8,509条人工标注的步骤注释,标注者间一致率为89.1%。它采用三元标注方案以捕捉探索行为,并引入错误传播规则以降低标注歧义。大量实验揭示了关键洞见:(1)较弱的策略模型因提前终止而表现出虚高的正确步骤占比;(2)区分中立动作与错误动作对当前模型而言仍是一项重大挑战;(3)过程衍生信号为结果监督提供了互补价值,显著增强了测试时扩展(test-time scaling)。我们希望AgentProcessBench能推动未来奖励模型研究,并为迈向通用智能体铺平道路。代码与数据可在 https://github.com/RUCBM/AgentProcessBench 获取。
