论文
PolyQ:为可扩展边缘 CPU LLM 推理共同设计端到端量化框架
PolyQ: Codesigning End-to-End Quantization Framework for Scalable Edge CPU LLM Inference
摘要
CPU 是设备上 LLM 推理的最通用目标,但现有的低位量化方法提供的要么是粗略操作点,要么是难以在 CPU 上高效执行的细粒度混合精度。我们提出了 PolyQ,一种面向 CPU 的编译器/量化协同设计,用于在用户指定的平均位预算下进行激活感知通道位分配。 PolyQ 从 $\{2,3,4,8,16\}$ 分配每个通道的位宽,然后使用编译时模型编译器将通道排列和聚类为位同质块,生成 SIMD 和 LUT 兼容内核,并合并跨运算符的兼容排列,以保持布局正则化远离运行时路径。这将细粒度预算拟合转变为仅用于 CPU 推理的实用小数位部署方法。在 WikiText-2 上的 Falcon-H1-3B、Llama2-13B 和 Qwen3-32B 中,PolyQ 提供了从 3--6\,b 稳定的质量缩放,并在 3\,b 目标上比之前的方法提高了 2.4--32.1\% 的困惑度。对三种代表性 CPU(工作站、笔记本电脑和移动设备)的端到端测量表明,编译器布局正则化可将激活重新排序流量减少高达 70.8%,预填充延迟和解码吞吐量几乎与配置的位预算成正比,并且相对于基于 LUT 的优化后端,能量/词元开销保持在 2% 以下。这些结果表明,小数位 CPU 部署在不同的边缘目标上是实用、可预测且节能的。