论文
WISErouter:具有工作负载预算约束的 LLM 路由
WISERouter: LLM Routing with Workload Budget Constraint
摘要
大语言模型 (LLM) 在多个域中实现了令人印象深刻的性能,但对每个查询使用最强大的模型在规模上是令人望而却步的。 LLM 路由通过将每个查询分配给合适的模型来平衡效用和预算,从而利用模型功能和成本的多样性。当前的方法有两个局限性:(i)它们要么使用并不总是强制执行预算约束的启发式方法,要么强加固定的每个查询预算,而该预算无法适应整个工作负载并导致性能不佳; (ii) 它们需要对密集数据集进行监督学习,其中包含每个查询模型对的统计数据,而收集这些数据的成本很高。为了应对这些挑战,我们将 LLM 路由制定为受限上下文多臂老虎机问题,并引入 WISErouter(简称 WR),这是一个支持从历史交互中进行离线学习以及通过探索进行在线学习的框架。我们进一步证明 WR-Online 在 $T$ 时间范围内实现了 $O(\sqrt{T})$ 的次线性后悔界限。 RouterBench 和 SWE-Bench 上的实证结果表明:(i) WR-Offline 在固定预算下超越了现有的性能基线,并且更严格地遵守预算限制;(ii) WR-Online 实现了与基线相当的性能,同时使用的勘探数据大幅减少。