论文

量化 大语言模型 的可靠性缩放定律

Reliability Scaling Laws for Quantized Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

量化是一种强大的策略,可以通过减少参数的位宽来构建功能强大且资源高效的 大语言模型 (LLM)。虽然量化 LLM 使用标准预测指标在未受干扰的输入上实现了最先进的性能,但使用可靠性指标测量的受干扰输入的性能仍然未被充分探索,尽管它对于可靠部署很重要。为了解决这一差距,我们首先对量化的 LLM 进行全面的可靠性评估,包括三个关键部分:(1)不确定性:我们使用六种不同的量化方法,采用既定的不确定性度量来评估量化为 2、3、4 和 8 位的 LLM 的可信度。 (2) 校准:我们评估量化模型的不确定性估计在模型尺度和位精度上的校准程度。 (3) 鲁棒性:我们设计字符级和单词级输入扰动,以评估在现实世界应用中出现的输入的语义保留变化下量化模型的可靠性。其次,我们描述了可靠性如何随模型位数的变化而变化。我们的研究表明,虽然性能随比特总数单调缩放,但可靠性缩放是非线性的。 4 位量化模型出现可靠性峰值,表明量化中等大小的模型可提供最佳的可靠性-效率权衡。此外,我们的实证研究结果表明,量化增强了 LLM 对自然输入扰动的鲁棒性。