论文

LLMRouterBench:面向LLM路由的大规模基准与统一框架

LLMRouterBench: A Massive Benchmark and Unified Framework for LLM Routing

模型评测基准与评测资源

摘要

大语言模型(LLM)路由将每个查询分配给模型集合中最合适的模型。我们推出LLMRouterBench,一个面向LLM路由的大规模基准与统一框架。它包含来自21个数据集、33个模型的超过40万个实例。此外,它为面向性能的路由与性能-成本权衡路由提供全面指标,并集成了10个代表性路由基线。借助LLMRouterBench,我们对该领域进行了系统重评。在确认强模型互补性——LLM路由的核心前提——的同时,我们发现许多路由方法在统一评测下表现相近,且若干近期方法(包括商业路由器)无法稳定超越一个简单基线。与此同时,与Oracle之间仍存在巨大差距,主要由持续的模型召回失败所致。我们进一步表明,骨干嵌入模型影响有限,更大的集合相比精心挑选模型收益递减,且该基准还支持延迟感知分析。所有代码与数据发布于 https://github.com/ynulihao/LLMRouterBench。

LLMRouterBench:面向LLM路由的大规模基准与统一框架
图2:LLMRouterBench 框架,集成 Collector、Evaluator 与 Adaptor 组件,用于对 LLM 路由方法进行标准化评估。