论文
MVPruner:加速自动驾驶多视角视觉语言模型的动态词元剪枝
MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving
摘要
自动驾驶视觉语言模型的多视角输入产生较长视觉词元序列,限制推理效率。现有固定剪枝比例及静态重要性指标未充分考虑不同视角和推理阶段的信息需求变化。作者分析发现,深层表示包含任务相关的视角先验,因此提出两阶段自适应词元剪枝MVPruner:第一阶段根据各视角的信息多样性分配预算,并保留跨阶段贡献稳定的词元;第二阶段依据指令文本分配预算和选择词元。四个基准用于评估。例如,DriveMM结合MVPruner在DriveLM上减少87.3%的浮点运算,预填充阶段加速4.97倍,摘要报告保留98.5%的准确率。