论文
充满信心地量化?代码生成量化的实证研究
Quantize with Confidence? An Empirical Study of Quantization for Code Generation
摘要
Ollama 等本地推理框架的日益普及使得开发人员在笔记本电脑和其他资源受限的硬件上运行大型代码模型变得越来越普遍。在这些设置中,后训练 量化对于减少内存占用和实现实际部署至关重要,但其对生成代码的影响仍未得到充分理解。我们使用 Python 和 Java 的多语言 McEval 和 CoderEval 基准,在两个代表性大型代码模型系列 Qwen2.5-Coder 和 CodeLlama 上对六种最先进的量化方法(GPTQ、AWQ、QuIP#、AQLM、BitsAndBytes 和 GGUF)进行了实证评估。我们评估功能正确性 (pass@1) 以及可维护性、可靠性、安全性和结构复杂性。我们还介绍了一种新颖的在不同提示复杂性下的稳健性分析,以香农熵和词元长度为特征。我们的结果表明,量化技术对正确性和代码质量的影响存在显着差异。 AQLM 始终匹配或超过全精度基线,而 QuIP# 表现出最大的正确性下降,特别是在复杂的提示上。安全属性在模型、基准测试和编程语言中保持稳定,而提示复杂性的稳健性因技术而异。这些发现为选择在资源受限的硬件上部署大型代码模型的量化策略提供了实用指导,并强调了评估量化模型超越功能正确性的重要性。