论文
用于测量推理优化如何影响输出质量的校准仪器
A Calibrated Instrument for Measuring How Inference Optimizations Affect Output Quality
摘要
大型语言模型优化是一个活跃的研究领域,涵盖模型权重的量化、跳层的提前退出方法以及推测性解码。每个曲目都使用自己的质量衡量标准,通常是特殊的基准分数。很少有人能够达到其他科学学科所需的测量精度。我们提出了一种严格的测量输出质量的方法,适用于跨系统和跨技术的比较。我们以大语言模型作为评判员对输出进行评分,但正式校准评判员:我们在给定相同提示的情况下比较模型两次普通运行的分数,验证它在统计等效输出和测量每个样本噪声之间没有显示出系统偏好。每个设计还包括一个“零”条件,可证明其分布与未修改的模型相同,其测量的差异必须为零。通过这一仪器,我们可以在相同的提示下测量多种加速技术,以便可以比较它们的质量成本。事实证明,感知质量高度依赖于话语领域。无论是英文散文还是中文,4 位模型与 16 位原始模型在我们设计的 +/-0.3 点分辨率下都没有什么区别。在 3 位精度下,相同的提示在英语散文中损失了 0.5 分,在中文中损失了 0.9 分,在多步数学中损失了 1.1 分;提前退出在散文上花费 0.7 分,在数学上花费 2.5 分,将正确解决的问题从 27 个中的 19 个减少到 6 个。这种模式适用于阿里巴巴和 Meta 的模型,但其量级不同:相同的量化器使 Meta 的模型花费了 1.8 分,而阿里巴巴的模型花费了 0.7 分。模型对标记的确定性可以预测它与完整模型的选择不同的可能性,但不能预测这种差异对判断质量的影响有多大,因此依赖于确定性的接受规则无法区分重要的错误和不重要的错误。