论文

大语言模型 中孟加拉语理解的量化效应:系统评估

Quantization Effects on Bangla Language Understanding in Large Language Models: A Systematic Evaluation

模型评测模型能力评测

摘要

后训练 量化降低了 大语言模型 (LLM) 的内存占用并加快了推理速度,这就是它现在在设备上部署中很常见的原因。然而,我们对其影响的了解大部分来自英国基准。目前尚不清楚同样的情况是否适用于形态复杂、资源匮乏的语言(例如孟加拉语),而我们在这里要解决的就是这一差距。我们在五个 Bangla 自然语言理解基准(Bangla MMLU、CommonsenseQA-BN、OpenBookQA-BN、PIQA-BN 和BoolQ-BN),通过 lm-evaluation-harness 使用零样本评估。据我们所知,这是 Bangla NLU 上量化格式的首次受控比较。这三个系列的反应并不相同:GPT-OSS 在 GGUF-W8A16 下的推理繁重任务上损失了高达 57.35% 的准确率,而 Qwen 和 LLaMA 在 GPTQ 下保持稳定,并且在少数情况下,量化版本的精度超过了全精度版本。 BoolQ-BN 是一项理解任务,无论格式如何,在所有三个系列中都保持稳定。总而言之,这些结果表明量化对于 Bangla 部署来说效果很好,但架构和量化方法的选择比单独的位宽更重要。我们讨论这对于选择在受限硬件上运行的模型的从业者意味着什么。