论文
最后:最后一个查询词元指导边缘云协作 MLLM 推理的视觉词元修剪
LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference
摘要
多模态基础模型正在将边缘云视觉智能从特定于任务的功能管道重塑为基于词元的界面,其中边缘设备将视觉输入编码为通用云 MLLM 的词元。然而,密集的视觉标记序列会增加云端推理成本。现有的修剪方法主要针对集中式推理:视觉驱动的方法可以在云执行之前运行,但通常与查询无关,而查询引导的方法通常依赖于目标 MLLM 的内部状态,并且无法在传输之前确定词元相关性。紧凑制导模型提供了一种替代方案,但现有设计可能需要昂贵的注意力聚合或辅助生成。我们提出了 LAST,一个 无需训练 框架,用于边缘云协作 MLLM 推理中依赖于查询的视觉标记修剪。 LAST 使用紧凑的边缘侧 VLM 作为指导代理,并从最后一个查询标记对视觉标记的关注中得出轻量级重要性信号。在因果关注下,最后一个查询标记可以关注完整的视觉序列和整个查询上下文,从而实现查询感知修剪,而无需云模型访问、自回归生成或多个查询位置的昂贵聚合。然后,LAST 在固定的 词元预算 下保留一组不同的与查询相关的视觉标记。我们在多个 词元预算 下针对具有不同指导策略的剪枝方法在 11 个多模态基准上评估 LAST。实验表明,LAST 始终保持最强的性能,保留了 95.4% 的全标记准确率,同时仅保留 12.5% 的视觉标记,边缘侧选择开销较低,云侧计算量也减少。