论文

模态感知零样本剪枝和稀疏注意力,实现高效多模态边缘推理

Modality-Aware Zero-Shot Pruning and Sparse Attention for Efficient Multimodal Edge Inference

模型优化模型压缩

摘要

边缘设备越来越多地运行多模式传感管道,尽管功率预算波动且传感器丢失不可预测,但这些管道必须保持准确。现有的修剪方法在这些条件下会失败:它们通常在压缩后需要 微调,消耗超过 10倍的部署能量,并且它们分配静态重要性分数,而这些分数不知道存在哪些传感器。我们提出了 SentryFuse 框架,它通过两个关键组件共同应对这两个挑战。首先,SentryGate 在训练期间通过一阶显着性监督学习模态条件重要性分数,然后在部署时修剪注意力头和前馈通道,而无需 微调。其次,SentryAttend 用稀疏的分组查询注意力取代了密集的自注意力(当代多模式架构中的一个关键瓶颈),使三种不同的多模式架构的 GFLOP 净减少了 15%。在三个应用程序和多模态骨干网中,SentryGate 的平均准确度比最强的剪枝基线提高了 12.7%,在模态 dropout 条件下提高了 18%。 SentryFuse 共同减少了 28.2% 的内存,并将延迟降低了高达 1.63 美元\times$,而无需进一步 微调,从而将模态感知零样本压缩建立为异构边缘硬件上多模态智能的实用路径。