论文

路由应该物有所值:经济的 LLM 路由的稀疏监督

Routing Should Pay for Itself: Sparse Supervision for Economical LLM Routing

AI 基础设施模型网关

摘要

大语言模型 (LLM) 路由通过将每个查询分配给适当的模型来降低服务成本,同时保持响应质量。然而,学习这样的路由器通常需要在历史查询上执行多个候选模型来收集查询模型质量反馈,从而在部署之前产生不小的监督成本。现有的工作主要集中在服务时间效率上,而忽略了由此产生的节省是否足以收回这笔前期支出。我们进一步观察到,路由质量通常在收集所有查询模型反馈之前就已经饱和,这表明密集监督可能会在经济上过度配置。我们提出了 SaveRouter,一种稀疏监督路由框架,它有选择地获取信息丰富的模型反馈并在相关查询之间共享能力信息,同时保留细粒度路由的查询级细化。我们通过共同考虑监督支出和随后的服务时间节省来评估路由。在四个路由基准测试中,主要设置仅使用约 33--41% 的可用训练反馈,同时保持有竞争力或更好的路由质量,并且与最快的传统路由器相比,将盈亏平衡部署量减少了约 1.9--9.5 倍。进一步的分析表明,获得更多的监督并不总是在经济上更有利:最小化服务成本的监督水平可能不同于实现最早回报的监督水平。我们的代码可在 https://github.com/LAMDA-Model-Reuse/SaveRouter. 上公开获取