论文

事半功倍:重新审视 LLM 修剪对测试时间缩放的有效性

Doing More With Less: Revisiting the Effectiveness of LLM Pruning for Test-Time Scaling

摘要

虽然当前的大语言模型 (LLM) 通过测试时计算扩展 (TTS) 表现出卓越的推理能力,但其大量的参数数量和较高的推理成本促使人们开发出剪枝方法,这些方法可以在不牺牲性能的情况下减小模型大小。然而,具体到推理 LLM,之前的工作表明,结构化修剪(删除整组层块的方法)会显着降低 TTS 推理性能。在这项工作中,我们重新审视这一假设,并研究非结构化剪枝(仅仔细删除某些冗余/有害权重的方法)是否表现出类似的局限性。令人惊讶的是,我们在两个推理 LLM(s1.1-7B 和 Qwen3-8B)上对四个推理基准进行的广泛实验一致表明,与结构化剪枝相比,非结构化剪枝增强了 TTS 性能,有时甚至优于未剪枝的全权重 LLM。此外,我们还实证研究了不同分层稀疏分配策略的影响,这是实例化非结构化剪枝方法的重要参数选择。这些发现挑战了修剪总是会降低 TTS 性能的传统观念,事实上,这表明仔细进行修剪可以进一步提高 TTS 效果。

事半功倍:重新审视 LLM 修剪对测试时间缩放的有效性
图 1:LLM 的结构化和非结构化修剪概述及其对测试时间扩展 (TTS) 推理性能的影响。正如之前的工作所指出的,通过结构化修剪删除整个层块会使大语言模型更容易产生不连贯的思想链,最终导致错误的答案。然而,正如我们的研究结果所示,非结构化修剪的情况并非如此,非结构化修剪可以通过有针对性的权重去除来显着增强 TTS 性能。