论文

LVSpec:利用视觉语义引导的宽松投机解码加速视频大模型

See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs

模型推理投机采样

摘要

视频大语言模型擅长视频理解,但自回归生成的推理延迟较高。投机解码使用草稿生成与核验机制缓解这一问题,然而既有方法受严格精确匹配限制,压缩了加速空间。本文提出LVSpec,一种专为视频大模型设计、无需训练的宽松投机解码框架。方法基于以下观察:少数与视觉有关的锚点词元需要严格核验,而大量与视觉无关的填充词元可采用宽松核验。LVSpec以轻量方法识别视觉相关词元,并加入位置偏移容忍机制,接纳位置不匹配但语义等价的词元。实验中,LVSpec保留了目标模型的主要性能,同时使Qwen2.5-VL-32B加速2.70倍、LLaVA-OneVision-72B加速2.94倍。相对先进的无需训练视频大模型投机解码方法,平均接受长度和加速比又分别提高136%和35%。