论文

通过残差矢量量化进行面向任务的视觉特征压缩,用于设备边缘多模态推理

Task-Oriented Visual Feature Compression via Residual Vector Quantization for Device-Edge Multimodal Inference

摘要

大型多模态模型 (LMM) 支持多种视觉理解和推理任务,但完全在资源受限的设备上运行通常不切实际。设备边缘协同推理减少了设备计算,但通过带宽有限的上行链路传输视觉数据可能会带来严重的延迟。面向任务的特征压缩(TOFC)通过特征聚合和熵编码减少有效负载。然而,连续特征编码仍然成本高昂,并且与查询无关的聚合可能会丢弃与任务相关的本地证据。我们提出了用于设备边缘多模态推理的查询引导的面向任务的特征压缩(Q-TOFC)。 Q-TOFC 采用残差矢量量化 (RVQ) 将每个合并特征编码为紧凑的码本索引序列,降低其表示成本并允许传输更多特征。它进一步将查询相关性合并到特征聚合中,并使用量化误差补偿适配器来减轻离散量化引入的失真。对七个多模态基准的实验表明,Q-TOFC 相对于 TOFC 减少了 53.6% 的视觉有效负载,同时保持了可比较的平均标准化任务性能。端到端延迟评估进一步证明了带宽受限的上行链路下的较低延迟。