论文
成本和容量约束下 大语言模型 的鲁棒批量级查询路由
Robust Batch-Level Query Routing for Large Language Models under Cost and Capacity Constraints
摘要
我们研究了在成本、GPU 资源和并发约束下将查询路由到 大语言模型 (LLM) 的问题。先前的每个查询路由方法通常无法控制批次级成本,特别是在非均匀或对抗性批次下。为了解决这个问题,我们提出了一个批次级的资源感知路由框架,该框架可以联合优化每个批次的模型分配,同时尊重成本和模型容量限制。我们进一步引入了一个强大的变体,可以解释预测的 LLM 性能的不确定性,以及平衡多个模型的质量和吞吐量的离线实例分配程序。对两个多任务 LLM 基准测试的实验表明,鲁棒性比非鲁棒同行提高了 1-14% 的准确度(取决于性能估计器),在对抗性批处理下,批处理级路由的性能比每个查询方法高出 24%,与非优化分配相比,优化的实例分配可带来高达 3% 的额外收益,同时严格控制成本和 GPU 资源限制。