论文

初始化决定盆地:极端 LLM 量化的高效码本优化

Initialisation Determines the Basin: Efficient Codebook Optimisation for Extreme LLM Quantization

摘要

加法量化可通过 O(1) 查找表反量化实现极端 LLM 压缩,使其对边缘部署具有吸引力。然而,在 2 位精度下,即使进行了广泛的搜索和微调,它也经常会发生灾难性的失败。我们表明主要瓶颈是码本初始化。贪婪的顺序初始化经常将模型置于较差的优化区域,随后的波束搜索和 PV 调整很难克服。我们通过表征比率 \r{ho} = N/KM 来分析这种行为,该比率表征了权重组和码本容量之间的关系,并提出了 OA-EM,一种使用 Hessian 加权马哈拉诺比斯距离的输出感知 EM 初始化方法。在压缩率、搜索预算和三种架构(Llama 3.2 3B、Llama 3.1 8B、Qwen 2.5 3B)方面,OA-EM 在 PV 调整后始终能产生更好的解决方案,并主导质量计算前沿。瓶颈的严重程度与 \r{ho} 成正比:在 3 bpp 时中等,但在 2 bpp 时极端,其中较差的初始化可能会使困惑度降低几个数量级。更广泛地说,我们的结果强调了压缩模型空间中优化几何的重要性,其中初始化可以主导后续搜索和 微调。