论文
EMMI:边缘多模态智能,通过融合表示压缩实现通信高效的 MLLM 推理
EMMI: Edge Multi-Modal Intelligence for Communication-Efficient MLLM Inference via Fused Representation Compression
摘要
多模态大语言模型(MLLM)的最新进展通过支持跨异构传感器模式(例如视觉、文本和遥测数据)进行推理,为边缘智能开辟了新的机遇。然而,由于现代 MLLM 的大量计算、内存和通信需求,在资源受限的边缘平台上部署这些功能仍然具有挑战性。边缘多模态智能 (EMMI) 不是传输原始传感器观测结果或在中间层划分神经网络,而是在边缘设备和服务器资源之间传递紧凑的表示,从而实现高效通信的边缘 MLLM 推理。为了实现这一目标,EMMI 执行模态特定编码、跨模态表示融合和边缘学习压缩,仅将紧凑的潜在表示传输到服务器端资源以进行高容量 MLLM 推理。这种以表示为中心的设计减少了通信开销,保护本地数据隐私,并在异构边缘设备和服务器端 MLLM 之间提供固定大小的接口。对代表性多模态基准的评估表明,EMMI 可以将通信负载减少 32 倍,同时保持相当的下游精度,从而在带宽受限的边缘条件下将估计的端到端推理延迟减少高达 3.4 倍。