论文
TwinRouterBench:针对真实代理 LLM 路由的快速静态和实时动态评估
TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing
摘要
LLM 路由在 编码智能体、深度研究系统和计算机使用代理等长期应用中最为重要,在这些应用中,单个用户请求会触发许多模型调用。将每个呼叫路由到最便宜的足够模型可以在不牺牲质量的情况下降低成本,但现有的路由器基准测试仅根据一次性提示来评估路由器。他们从不在中间代理步骤暴露路由器可见的前缀,从不测试更便宜的替代品是否可以保持下游任务的成功,并且通常在评估时依赖在线 LLM 判断。我们推出了 TwinRouterBench,这是一个具有两个轨道的步进级路由基准测试。静态跟踪提供来自 SWE-bench、BFCL、mtRAG、QMSum 和 PinchBench 的 520 个实例的 970 个路由器可见前缀,每个前缀都与根据已发布的降级和级联协议估计的经过执行验证的目标层配对;评分是关于层标签、轨迹成员资格和词元成本的确定性算术,没有在线评估者端 LLM 判断。动态轨道提供了一个Harness,可在完整的 500 箱 SWE 工作台验证套件上运行路由器;在本文中,我们报告了与静态 SWE 监督分裂脱节的 100 个案例的保留评估。在每次 LLM 调用时,路由器都会从锁定池中选择一个具体模型,并通过官方任务解析和已实现的 API 支出来衡量成功与否。这两个轨道支持快速离线迭代,然后在实时代理执行下进行端到端验证。代码和数据可在 https://github.com/CommonstackAI/TwinRouterBench 获取。