论文

GRINQH:基于分级输入的量化层次结构,用于高效生成 LLM

GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation

摘要

使用 LLM 进行自回归解码主要受到 GPU 内存带宽的瓶颈,特别是在边缘计算设置中。虽然量化对于缓解这一瓶颈至关重要,但大多数现有方法将推理视为统一过程,并且未能考虑计算限制预填充阶段和内存限制解码阶段之间的不对称性。我们提出了GRINQH(基于GRated IInput的量化层次结构),这是一种仅权重的后训练量化框架,通过统一量化和稀疏化来加速解码。 GRINQH 利用激活幅度作为计算重要性的代理,将权重通道动态分配到不同的精度级别,从而在解码期间实现灵活的平均位宽度。在 Llama3 和 Qwen3 模型上进行评估,GRINQH 在相当的 3 位和 4 位设置下优于最先进的固定精度和混合精度基线,甚至能够实现有效的 2 位生成。我们通过在自定义 GPU 内核中利用分层嵌套内存布局进行多精度存储来实验验证理论加速。最终,GRINQH 为 LLM 生成建立了一个新的最先进的帕累托前沿,实现生成质量和推理速度之间的动态权衡。