论文
越精细越好(使用正确的缩放比例)
Finer is Better (with the Right Scaling)
摘要
微缩放是保持量化为超低精度格式的 大语言模型 (LLM) 质量的关键技术。直观上,更精细的块大小应该会产生更低的量化误差;然而,Fasoli 等人最近发现了一个悖论。 (2026) 证明,随着块大小的缩小,标准的绝对最大缩放实际上会导致模型质量下降。在这项工作中,我们研究了这种现象的根本机制。我们证明,这种退化并不是更细粒度的固有限制,而是主要是由较小块中的元素如何统计地聚集到更接近其局部块最大值所驱动的,与用作缩放因子的粗次正规 E4M3 值相互作用很差。具体来说,我们表明,i)防止缩放因子下溢到零可以减轻极端下溢引起的错误,ii)有针对性的算法干预(例如 4-over-6 方法,为缩放因子的选择提供更大的灵活性)解决了较大值的悖论,以及 iii)强力搜索建立了最佳基线,证实理论均方误差(MSE)随着更精细的块大小而严格改善。最终,我们的研究结果强调了硬件-软件协同设计的一个重要见解:块大小悖论部分是天真的规模选择的产物。虽然使用分层缩放因子或更宽的格式(如 UE5M3)可以互换地解决大部分质量损失,但我们发现 4-over-6 缩放选择启发式甚至可以进一步提高质量,特别是对于非常小的块大小。因此,要最大限度地提高下一代机器学习加速器的性能,需要将芯片格式规范和软件扩展算法视为紧密耦合的设计选择。