论文

压缩语言模型中的分歧如何成为决策翻转

How Divergence Becomes Decision Flips in Compressed Language Models

模型评测评测方法与指标

摘要

压缩报告总结了压缩语言模型与稠密语言模型的距离,通常是 KL 散度;依赖于稠密模型输出的部署需要知道其决策的数量发生了变化。我们证明是总变差距离,而不是 KL,直接回答了这个问题。在五个语料库和九个机制各不相同的扰动族上的 19 个开放模型的 802 个压缩和扰动副本中,arg-max 词元变化的速率 (flip rate) 以与中值 $1.05$ 的比率跟踪总变差距离,没有拟合常数。 KL 仅通过其平方根以及在模型和语料库中变化四倍的因子转换为翻转,因为 KL 在求根之前对标记进行平均;每个词元平均的一阶统计数据,例如Hellinger距离,避免了这种情况,但报告很少给出它们。因此,在不同模型和语料库上报告的翻转率至少相差 $10%$ 的两个压缩器中,KL 将较小的差异分配给在 $11%$ 案例中改变更多决策的那个,总变差距离在 $1%$ 中。两项预先注册的测试标志着极限:在留出的代码语料库上,所有八个模型的比率都保持不变,而关于 KL 的三个预测中,三个关于KL的预测各自在至少一半模型上失败;在具有真实内核的三个新模型上,它在 38 个检查点中的 37 个检查点中保持在其范围内,但在两个模型的代码上低于 1。在 vLLM 推测性解码中,在教师强制下测量的总变差距离可以预测贪婪草稿接受,其平均相对误差为 $1.1$--$2.4%$,而无需 KL 所需的特定于任务的校准。