论文

基准错觉:修剪后的 LLM 可以通过多项选择但无法回答

The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

模型评测模型能力评测

摘要

压缩 大语言模型 可以减少内存使用和推理成本,但它也会造成标准基准测试遗漏的故障。修剪后的模型可能在多项选择评估中仍然表现良好,但无法在开放生成中回答相同的问题。我们问修剪会改变什么:它是否会删除正确的答案,或者是否会使答案更难以作为顶部输出生成?我们通过多语言问答来研究这个问题,跟踪修剪前后的相同问题。我们找到了一个基准幻觉。在高稀疏剪枝下,尤其是 Wanda 下,模型经常在贪婪开放生成中失败,而在多项选择评分下仍然选择正确答案。在这些仅识别的错误中,答案通常不会消失,而是降级:它经常通过波束搜索、采样或一个上下文示例重新出现。总体而言,多项选择基准测试可能会夸大压缩 LLM 的可用性,从而造成评估盲点。压缩模型应该测试它们可以产生什么,而不仅仅是它们可以识别什么。