论文

用于边缘AI推理加速的通用优化引擎(GOE)

A Generalized Optimization Engine (GOE) for Edge AI Inference Acceleration

模型优化模型压缩

摘要

人工智能 (AI) 模型已在各个领域展示了卓越的功能,但其广泛部署却受到巨大的计算成本的阻碍,特别是在资源受限的设备上。本文探讨了各种人工智能模型优化技术、算法和抽象的理论基础,讨论了它们降低计算复杂性、内存占用、延迟和功耗的潜力。此外,我们提出了一种全面的硬件(HW)和与模型无关的广义优化架构,该架构集成了这些技术以提高效率。我们的研究强调了这种广义优化系统在战术环境中资源受限的异构硬件上准备模型部署方面的关键作用。作为具体演示,我们展示了 GOE 压缩语言模型在无 GPU 的边缘 CPU 上部署和运行,并且压缩方法的选择(而不仅仅是其标称位宽)决定了任务准确性是否能够在部署中幸存。