论文

ConsRoute:面向云-边-端大语言模型的一致性感知自适应查询路由

ConsRoute:Consistency-Aware Adaptive Query Routing for Cloud-Edge-Device Large Language Models

AI 基础设施推理服务

摘要

大语言模型(LLM)能力出色,但会带来可观的推理延迟与成本,阻碍了其在延迟敏感和资源受限场景中的部署。云-边-端协同推理通过将查询动态路由到各层级不同能力的模型,已成为一种有前景的范式。本文提出ConsRoute,一个轻量、语义感知且自适应的路由框架,可显著提升推理效率,同时将对响应质量的影响降至最低。与以往依赖预测粗粒度输出质量差距的路由方法不同,ConsRoute利用重排序器直接评估不同层级模型所生成响应之间的语义一致性,为路由产生细粒度的软监督信号。为最小化端侧开销,ConsRoute复用LLM预填充阶段的隐藏状态作为紧凑的查询表示,避免额外的编码器或推理过程。此外,对这些表示进行聚类,并采用贝叶斯优化学习簇特定的路由阈值,在异构查询分布下动态平衡质量、延迟与成本。大量实验表明,ConsRoute达到接近云端的性能(>=95%),同时将端到端延迟与推理成本降低近40%,在响应质量与系统效率上均持续优于现有路由基线。

ConsRoute:面向云-边-端大语言模型的一致性感知自适应查询路由:论文配图
图 2:ConsRoute 框架概述。右下角显示了语义表示提取器,它利用 DLM 来提取输入语义(第 IV-B 节)。左下角显示了预测器的训练数据构建过程,右上角显示了轻量级一致性预测器,它决定查询应路由到哪个模型层(第 IV-C 节)。左上角显示自适应路由策略,其中适当的路由阈值通过贝叶斯优化确定(第 IV-D 节)。