论文

CoVSpec:经投机解码实现视觉语言模型的高效端云协同推理

CoVSpec: Efficient Device-Edge Co-Inference for Vision-Language Models via Speculative Decoding

模型推理投机采样

摘要

视觉语言模型(VLM)在多模态感知与推理上能力强劲。但将大型VLM部署到移动设备仍具挑战,因其计算与内存需求庞大。一种实用替代是端云协同推理:移动端轻量草稿VLM与边缘服务器上更大的目标VLM经投机解码协作。然而直接把投机解码扩展到VLM会因过多的视觉token计算与高通信开销而严重低效。为此我们提出CoVSpec,一个面向VLM推理的高效协同投机解码框架。具体地,我们首先开发免训练的视觉token缩减框架,在移动端联合考虑查询相关性、token活跃度与低秩依赖来剪除冗余视觉token。此外,我们设计自适应草稿策略,动态调整验证频率与草稿长度。另外,我们引入带解耦验证-修正的并行分支机制,提升目标侧验证期间的草稿侧利用率并降低修正相关传输开销。多基准实验显示,CoVSpec吞吐量较仅目标推理最高提升2.21倍,通信开销较基线降低超过96%,且不损任务精度。

CoVSpec:经投机解码实现视觉语言模型的高效端云协同推理:论文配图
图1:CoVSpec示意:通信感知的端云协同投机解码框架及视觉token裁剪位置。