论文

INAR-VL:用于边缘云视觉语言推理的输入感知路由

INAR-VL: Input-Aware Routing for Edge-Cloud Vision-Language Inference

AI 基础设施推理服务

摘要

视觉语言模型 (VLM) 的边缘部署面临延迟和准确性之间的权衡:云执行提供高质量的预测,但会产生通信延迟和能源成本,而仅边缘执行速度更快,但由于模型容量有限,准确性较低。由于图像质量的异质性和推理复杂性,这种权衡变​​得更加复杂,使得静态放置不是最优的。我们推出了 INAR-VL,这是一种轻量级边缘云路由系统,用于在两层部署中进行多模态推理。 INAR-VL 跨边缘和云维护互补的 VLM,并使用轻量级图像和文本复杂性信号来指导路由和模型选择,在本地执行简单查询,同时在有利时卸载复杂查询。对视觉问答的评估表明,INAR-VL 在边缘执行了 36% 的请求,减少了 24% 的延迟,降低了 26% 的能耗,并保留了 97% 的云级精度。