论文
任务级与会话级模型路由:四个开源路由器在四个基准上的统一接口混合评测
Task- and Session-Level Model Routing: A Common-Interface Hybrid Evaluation of Four Open-Source Routers Across Four Benchmarks
摘要
智能体系统日益将模型选择委托给路由器,但开源路由器通常在不同的任务、候选池与执行协议下被评测,限制了直接比较。我们提出统一的测量协议,对四个路由器实现跨RouterBench、BFCL v4、tau2-bench与WebArena进行混合评测。我们在2,610个候选结果的锁定矩阵上评估290个冻结任务。三个路由器给出恒定或近恒定的档位分配;只有vLLM Semantic Router随提示内容发生实质变化,但它在四个基准上的观测成功率均非最高。Always-Mid在三个基准上与Aurelio完全持平,在第四个上差距不超过0.003。就vLLM而言,任务级优越性检验未发现相对份额匹配的内容盲分配存在任务特定优势;等效性仅在WebArena上按协议声明的五个百分点边际成立。结果表明,在这些配置与控制条件下,观测到的收益更多追随所选档位的构成,而非可证实的任务级定向选择。因此,固定档位基线与所选档位分布是路由评测中必要的对照;这些发现限定于上述配置、候选池与冻结的基准样本,不适用于路由范式的一般情形。