一次成功不等于可靠:Thinkingbox有状态业务任务评测
One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows
摘要
最近的代理基准测试越来越多地在可执行环境中进行评估,从代码修复到 Web 导航、应用程序 API 和函数调用。然而,完成代码之外的后续工作需要的不仅仅是产生合理的响应或有效的工具调用:代理必须在多个轮次中收集丢失的信息,遵循域策略,协调相关工具,并实现正确的持久状态转换而不产生附带影响。在本文中,我们介绍了 Thinkingbox,这是一个用于工具-代理-用户交互的沙箱,它提供隔离的 MCP 兼容工具会话、完整的执行跟踪以及对终端后端状态的结果评估。 Thinkingbox-bench 构建于该沙盒之上,包含 507 个策略调节的工作流程,涵盖众多场景,包括零售、酒店、汽车保险、neobank 内部 IT 以及咨询 IT/HR 支持。每次尝试都通过特定于任务的可执行检查进行评估,这些检查接受有效的轨迹,同时拒绝错误、缺失或额外的影响;指定任务还检查最终响应所需的属性。在专有模型和开放权重模型中,最强模型 Claude Opus 5 达到了 66.50% pass@1,但只有 47.53% pass^20。此外,许多失败的试验显示了干净的终止和有效的状态更改操作,这表明响应或工具调用级信号并不是端到端任务完成的明确代理。 Thinkingbox-bench 揭示了偶尔找到成功轨迹与可靠完成有状态业务任务之间的巨大差距。我们发布了 Thinkingbox 和 Thinkingbox-Bench:https://github.com/microsoft/thinkingbox