论文

APreQEL:边缘自适应混合精度量化 LLM

APreQEL: Adaptive Mixed Precision Quantization For Edge LLMs

摘要

如今,大语言模型 在推理、代码生成和复杂问题解决等各种任务中展现了自己的优势。然而,这种进步伴随着较高的计算成本和内存要求,使得在边缘设备上部署这些模型以确保实时响应和数据隐私变得具有挑战性。量化是减少内存使用的一种常见方法,但大多数方法在所有层上统一应用它。这没有考虑到不同层对精度降低的响应可能不同的事实。重要的是,内存消耗和计算吞吐量不一定一致,这使部署决策进一步复杂化。本文提出了一种自适应混合精度量化机制,可以在用户定义的优先级下平衡边缘部署中的内存、延迟和准确性。这是通过分析分层贡献并推断不同量化类型在目标硬件平台上的行为方式来实现的,以便为每一层分配最合适的量化类型。这种集成确保了设计中同时考虑了层的重要性和整体性能的权衡。我们的工作解锁了统一量化无法实现的新配置设计,扩展了解决方案空间,以便在资源受限的设备上高效部署 LLM。