论文
量化陷阱:破坏多跳推理中的线性缩放律
The Quantization Trap: Breaking Linear Scaling Laws in Multi-Hop Reasoning
摘要
神经网络缩放律为AI进步提供了可预测的路径:降低数值精度应线性提高计算效率和能耗表现(能耗E与比特数成正比)。本文表明,这一缩放律在多跳推理中失效。我们发现一种“量化陷阱”:将精度从16位降至8位或4位,反而增加总净能耗,同时降低推理准确率。我们给出严格的理论分解,将这一失效归因于硬件类型转换开销、反量化内核的隐性延迟成本,以及顺序执行中的能耗摊销失效。反量化内核成本会成为顺序推理链中的主要瓶颈。因此,实际运行中难以避免缩放律失效。我们的发现表明,业界“越小越好”的经验法则对复杂推理任务在数学上可能适得其反。
