论文
K 量化及其对输出性能的影响
K-Quantization and its Impact on Output Performance
摘要
大语言模型(LLM)的最新进展在许多 NLP 任务中显示了其卓越的能力。然而,它们的庞大规模常常给部署带来挑战。这就需要有效的模型压缩技术,而量化则成为一种突出的解决方案。尽管有很多好处,但量化(从 2 位到 6 位)对 LLM 性能和准确性的确切影响仍然是一个活跃的研究领域。本文研究了 8 个 LLM 在不同量化级别的性能,重点关注用于知识处理和推理的 MMLU-Pro、用于代码理解的 CRUXEval 和用于阅读理解的 MuSR 等任务。我们的结果显示出一致的趋势,即更高的精度(例如 8 位 Q8\_0)会提高性能,尽管收益递减。积极的量化(例如,2 位 Q2\_K)通常会保留可接受的精度,尽管某些模型显示出性能的显着损失。我们的研究结果表明,虽然较低的位精度通常会降低性能,但其影响因模型和任务而异。较大的模型对激进量化表现出更大的弹性,但在较低的精度水平下仍然可能会出现显着下降。 7-90 亿个参数范围的中型模型在效率和资源使用之间取得了最佳平衡。这些结果提供了对模型大小、量化和性能之间权衡的见解。