论文
H 尺度:针对 NVFP4 子字节 LLM 推理的 Hessian 引导尺度细化
H-Scale: Hessian-Guided Scale Refinement for NVFP4 Sub-Byte LLM Inference
摘要
NVIDIA Blackwell 架构原生支持超细粒度 NVFP4 格式,为加速 大语言模型 (LLM) 推理提供了新的机会。 NVFP4 的微块设计(例如 16 的组大小)为捕获局部权重分布和隔离异常值提供了强大的表示灵活性,但它也引入了每组缩放因子的大且高度敏感的空间。现有的 后训练 量化 (PTQ) 方法主要侧重于细化量化权重值,而对比例选择步骤的探索还不够。为了解决这一差距,我们提出了 \textbf{H-Scale},这是一种用于 NVFP4 每组尺度细化的轻量级后处理方法。 H-Scale 不是最小化普通权重重建误差,而是使用从校准激活导出的对角二阶代理来选择硬件有效的组尺度,从而更直接地针对层输出扰动。它被设计为各种 NVFP4 管道中 RTN 式比例选择的直接替代品,仅需要适度的离线校准,并且在推理时引入严格的零开销。在固定的评估协议下,主流 LLM 上的实验表明,H-Scale 总体上改善了广泛的 NVFP4 基线,并使多个变体更接近 BF16 参考。