论文
EdgeFM:视觉语言模型的高效边缘推理
EdgeFM: Efficient Edge Inference for Vision-Language Models
摘要
视觉语言模型(VLM)在边缘工业应用中表现出强大的适用性,但其部署仍然受到资源限制下确定性低延迟和稳定执行要求的严重限制。现有框架要么依赖于臃肿的通用设计,要么迫使开发人员进入不透明的、特定于硬件的闭源生态系统,导致硬件锁定限制和跨平台适应性差。观察到现代人工智能代理可以有效地搜索和调整配置,为标准 LLM 运算符生成高度优化的低级内核,我们提出了 EdgeFM,这是一种轻量级、代理驱动的 VLM/LLM 推理框架,专为跨平台工业边缘部署而定制。 EdgeFM 删除了非必要的功能以减少单请求延迟,并将代理调整的内核优化封装为可重用技能的模块化库。通过允许直接调用这些技能而不是等待闭源实现,它有效地缩小了长期以来由专有工具链主导的性能差距。该框架原生支持x86、NVIDIA Orin SoC等主流平台,并在国内Horizon Journey平台上首次实现端到端VLA部署,增强了跨平台可移植性。在大多数情况下,它的推理性能明显优于传统的供应商特定工具链,在 NVIDIA Orin 平台上比 TensorRT-Edge-LLM 实现高达 1.49 倍的加速。实验结果表明,EdgeFM具有良好的端到端推理性能,为多种边缘工业场景提供开源、生产级的解决方案。