论文

量化陷阱:破坏多跳推理中的线性缩放律

The Quantization Trap: Breaking Linear Scaling Laws in Multi-Hop Reasoning

模型评测模型行为与机制分析

摘要

神经网络缩放律为AI进步提供了可预测的路径:降低数值精度应线性提高计算效率和能耗表现(能耗E与比特数成正比)。本文表明,这一缩放律在多跳推理中失效。我们发现一种“量化陷阱”:将精度从16位降至8位或4位,反而增加总净能耗,同时降低推理准确率。我们给出严格的理论分解,将这一失效归因于硬件类型转换开销、反量化内核的隐性延迟成本,以及顺序执行中的能耗摊销失效。反量化内核成本会成为顺序推理链中的主要瓶颈。因此,实际运行中难以避免缩放律失效。我们的发现表明,业界“越小越好”的经验法则对复杂推理任务在数学上可能适得其反。

量化陷阱:破坏多跳推理中的线性缩放律
图1:可持续性反转(Mistral-7B,GSM8K)。(A) 物理遥测(Physical Telemetry):在 L4/A100/H100 上将精度降至 8/4-bit 会触发非单调的吞吐崩溃和能耗尖峰;由于软件模拟的类型转换开销,FP16 反而更高效。(B) 可持续性流形(Sustainability Manifold):指标(T_SI、E_SI、S_SI)显示低比特配置被 Pareto 支配。8-bit 代表系统性失败,而 4-bit 则标志着一个“量化陷阱”(Quantization Trap),相对于 FP16 基准存在 31.1% 的全局 SI 赤字。