论文

超越激活对齐:任务感知 LLM 量化中的对齐与多样性权衡

Beyond Activation Alignment:The Alignment-Diversity Tradeoff in Task-Aware LLM Quantization

摘要

混合精度量化 (MPQ) 已成为在严格的内存和计算限制下部署 大语言模型 的关键技术。我们首先确定了一种称为“困惑错觉”的现象:根据基于困惑的敏感性排名为重要的层与那些对复杂推理性能影响最大的层几乎没有排名相关性,在我们的分析中,Kendall $τ\approx 0$。我们进一步揭示了对齐-多样性权衡:仅使用目标任务校准数据可能会降低量化后性能,而合并通用域数据可以稳定灵敏度估计并提高跨任务的鲁棒性。基于这些观察,我们提出了 TASA(任务感知灵敏度分析),这是一个两级框架,可联合优化校准数据组合和混合精度位分配。具体来说,TASA 使用 无需训练 梯度跟踪对齐标准搜索校准数据混合物,然后聚合困惑度和面向推理的敏感度信号以指导层间和层内比特分配。 LLaMA-3-8B 和 Qwen2.5-7B 上的实验揭示了精度反转:适当分配的 3.5 位模型可以匹配或超越任务感知能力较低的 4 位基线。在平均精度为 3.5 位的情况下,TASA 在总体精度方面匹配或优于多个竞争性 4 位统一基线,并且在 LLaMA-3-8B 上比 GSM8K 上最强的 W3 基线提高了 20 多个绝对点。这些结果表明,校准数据的组成极大地影响了任务敏感的量化,这是先前工作中尚未充分探索的一个因素。