论文
较小的模型,意外的成本:LLM 量化与自动程序修复的权衡
Smaller Models, Unexpected Costs: Trade-offs in LLM Quantization for Automated Program Repair
摘要
大语言模型 (LLM) 是功能强大的工具,越来越多地用于复杂的软件工程任务。随着参数数量的增加,结果通常可以得到改善,但这也带来了大量的内存需求。虽然量化有效地减少了内存占用,但其总体影响通常只能通过基准分数来概括,这掩盖了模型行为和非功能开销的变化。在这项工作中,我们使用自动程序修复(APR)(软件工程中的一项复杂任务)对 LLM 量化进行了实证评估。我们分析了 6 个代表性 LLM 中跨越不同位宽、方法和目标组件(权重和 KV 缓存)的 13 种量化配置,并在两个 APR 基准(HumanEval-Java 和 Defects4J)上进行了评估。我们的研究结果表明,基础模型和量化模型可以提供不同组的已修复问题,几乎没有重叠,同时保留相当数量的已修复问题。尽管量化成功地将内存占用量减少了高达 85%,但它增加了推理时间和能耗,我们将其归因于硬件利用率不理想。我们的帕累托权衡分析表明,48% 的评估配置严格由替代方案主导。我们的研究结果强调,有效性、内存占用和能源效率之间的权衡对底层模型架构和任务的复杂性很敏感,而不是确定一种更好的量化方法。