论文

Pro-Router:结合自适应端云协作的词元感知渐进式模型路由,实现高效多模态大语言模型推理

Pro-Router: Token-Aware Progressive Model Routing with Adaptive Edge-Cloud Collaboration for Efficient Multimodal LLM Inference

AI 基础设施推理服务

摘要

多模态大语言模型(MLLM)的卓越性能是以大量计算开销为代价的,这对实时部署和成本效益提出了重大挑战。现有的模型路由方法要么仅根据粗略的请求级特征进行决策,要么花费一个或多个额外的语言模型传递来检查生成的响应,而未使用生成过程中出现的词元级不确定性信号。为了解决这些限制,我们提出了 Pro-Router,这是一种词元感知渐进式模型路由方法,具有自适应边缘云协作功能,可实现高效的多模态 LLM 推理。 Pro-Router 采用两阶段渐进决策机制。首先,轻量级提示预评分器模块在词元生成开始之前执行快速预筛选,将看似简单的请求引导到小型模型。其次,词元感知验证器读取小模型生成的每个词元的采样概率分布,估计模型对其自身输出的置信度,以确定每个请求的答案是否传送或升级到基于云的高精度模型。此外,我们设计了一个自适应边缘云服务管道,可根据每个设备测量的服务速率调整每次调度的大小,因此边缘层和云层都可以充分利用,无需手动调整参数,并且不会受到网络延迟的影响。对多个多模态基准数据集和模型的大量实验证明了 Pro-Router 的有效性。与其他方法相比,它实现了最高的路由精度,并将路由速度提高了10倍以上。其服务管道的端到端吞吐量也比现有模型路由管道高出 75% 以上。我们的代码可在 https://github.com/xinyuangui2/pro-router 获取。

Pro-Router:结合自适应端云协作的令牌感知渐进式模型路由,实现高效多模态大语言模型推理:论文配图
图1 现有的两种选择路线方法。(a) 在产生任何征兆之前,只要求的路由器对来自即时方的每项请求的难度进行评分;低于门槛值的请求转到小模式,其余则直接转到大模式。(b) 以反应为基础的路由器让小型模型首先回答问题,并赢得每次反应的航运信心;自信的响应船,其余升至大型再生模式。