论文

GAMMA:任意预算下混合精度模型的全局比特分配

GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets

摘要

混合精度量化通过向敏感模块分配更多位来改善 大语言模型 (LLM) 的预算与精度权衡。然而,在 LLM 规模上自动化这种分配面临着独特的约束组合:可学习的方法需要量化感知训练,这对于十亿参数的模型来说是不可行的; 无需训练 替代方案依赖于静态代理指标,这些指标会错过跨模块交互,并且必须根据目标预算重新计算;基于搜索的方法成本高昂,无法保证准确的预算合规性。我们提出了 GAMMA,一个与量化器无关的框架,它完全在 后训练 管道中学习模块级精度偏好。 GAMMA 在增强拉格朗日约束下优化教师强制的隐藏状态重建目标,并通过整数规划将学习到的偏好投影到精确的预算可行的离散分配中。一个关键属性是分数重用:因为学习到的偏好编码了稳定的敏感度排名而不是特定于预算的权重,因此单次训练运行通过仅重新求解整数程序来服务于任意部署目标,从而将每个预算的适应时间从几小时缩短到几分钟。在 Llama 和 Qwen 模型 (8B--32B) 中,GAMMA 的性能优于固定精度基线(高达 +12.99 平均)和基于搜索的混合精度方法(高达 +7.00 平均),并且可以在 2.5 位平均精度下匹配固定 3 位质量,从而能够以更小的内存占用进行部署。