论文
推理感知压缩:保护脆弱推理回路以降低LLM部署能耗
Reasoning-Aware Compression: Identifying and Protecting Vulnerable Reasoning Circuits for Energy-Efficient LLM Deployment
摘要
大型推理模型 (LRM) 在部署过程中会产生大量能源成本,而当前的压缩方法在所有组件上应用统一量化,存在损坏关键推理电路的风险。我们提出了一个推理感知压缩框架,通过硬件级 GPU 能量测量,对 GSM8K、FOLIO、MATH-500、ProofWriter 和 MuSiQue 五个推理基准的量化条件进行基准;通过对保留的校准分割进行扰动扫描,分析所有 196-224(层、投影)对中每个模块的 INT4 漏洞,然后有选择地将最敏感的电路恢复到 FP16。出现了三个发现。首先,INT4量化可以通过延伸推理链来增加能量;在 GSM8K 上,25% 的功率减少会带来净能量增加。其次,脆弱性是依赖于任务的:注意力投射对于数学推理来说更为关键,并且敏感性模式因逻辑推理中的架构而异。第三,选择性压缩实现了统一方法无法达到的帕累托最优点:ProofWriter 上的 R1-Qwen-7B Top-10% 在 -9.7% 的能量下比 FP16 获得了 +12 个百分点,并在五个推理基准的保留数据上进行了验证。
