说,不知道:积极的 GGUF 量化小语言模型仍然写出他们无法再定义的稀有单词
Saying, Not Knowing: Aggressively GGUF-Quantized Small Language Models Still Write Rare Words They Can No Longer Define
摘要
后训练量化为 GGUF 格式的混合精度 K 量化是开放权重语言模型到达消费类硬件的常见方式,但其对细粒度词汇能力的影响尚未表征。我们审核了 13 个系列和 4 个架构骨干模型、0.35B-14B 参数中的 27 个量化工件,对两个探针下的 429 个经频率验证的罕见英语单词进行了评估,将其发布的阶梯向下评估到 Q2_K(每个权重约 2.6 位):提示提供的单词及其单句定义的表面包含,按分层评分多同义词匹配器,其误差由每个定义的盲LLM判断普查与人类验证测量。第二季度出现了三种情况:完全崩溃为不可用的构建、亚 2B 模型中的严重语义分离以及大约 3B 以上的大部分稳健保留。在每个 sub-2B 工件中,定义比工件的基线低 20-67%,通常是包含损失的几倍。两个控制将稀有性与任务难度分开:在稀有词组中,七个 2B 级工件中的六个中的丢失随着稀有度的增加而增加,而在 100 个单词的常用词集中,在所有 8 个词中,稀有词的丢失多于常见词,其中 6 个明显。分词器词汇量大小不能预测损害(Spearman rho=0.12); 参数计数占主导地位 (rho=0.72),这在六个相同分词器家族中的五个中得到了证实。 Q4_K_M 在 >=1B 时保持词法干净。损害是频率分级的,依赖于提供者,并且不通过 WikiText-2 困惑度进行校准:在九个工件匹配的阶梯中,几乎相同的 Q2 惩罚 (44.7%/47.6%) 将保留其定义的工件 (3.6%) 与丢失定义的工件 (43.6%) 分开。积极量化的小模型可以继续生成流畅的文本,但不再知道它的含义,从而在语义带来后果的领域中冒着硬件受限部署的风险。验证必须针对每个工件。
