论文
稀疏上下文与共享预算下的漂移感知大语言模型路由
Drift-Aware LLM Routing with Sparse Contexts and Shared Budgets
摘要
多模型语言服务必须路由每个请求,同时保留计算、延迟、内存或货币成本的工作负载级别预算。有两个特征使这个问题比静态模型选择更加困难。提示表示是高维的,因此只有一小部分嵌入方向可以预测模型的增量值,并且请求组合和模型前沿在启动、微调、量化更改和系统更新后都会发生漂移。我们制定了具有多个背包约束的非平稳稀疏上下文路由和一个可选的影子审核流,该流可以评估多个模型上的一小部分提示。我们提出漂移感知稀疏路由(DRS)。该政策通过滚动审计窗口来估计奖励和资源使用情况,使用悲观奖励和乐观成本估计的路线,在线更新资源影子价格,并在承诺之前应用硬计量。该分析将控制与统计分开。在任何具有统一预测半径 $\{β_t\}$ 的事件中,对节奏动态流体基准的遗憾受到半径总和、容量缓冲项和 $O(\sqrt{T})$ 节奏项的限制。在稀疏线性模型和有界漂移 $V_T$ 下,滚动估计给出 \[ \widetilde O\left( T\sqrt{\frac{s}{ρW}}+WV_T+\sqrt{T} \right), \] 其中 $s$ 是稀疏度,$ρ$ 是审核率,$W$ 是窗口长度。当 $V_T=0$ 和漂移下的 $O(T^{2/3}(s/ρ)^{1/3}V_T^{1/3})$ 适应项时,优化 $W$ 会产生通常的固定 $O(\sqrt{sT/ρ})$ 速率。