论文

ReSET:通过步进感知温度缩放进行准确的延迟关键型 NVFP4 推理

ReSET: Accurate Latency-Critical NVFP4 Reasoning via Step-Aware Temperature Scaling

模型推理解码与生成控制

摘要

大型推理模型 (LRM) 通过生成长的中间推理轨迹来改进复杂问题的解决,但这会大大增加推理成本。 NVFP4 推理提供了一种有前途的方法,通过硬件支持的低精度执行来降低计算和内存成本。然而,直接将 NVFP4 应用于 LRM 会带来两个实际限制:量化下推理精度会降低,并且现有 NVFP4 内核无法完全实现小批量自回归解码中的延迟优势。在这项工作中,我们分析了 NVFP4 量化对推理过程中 词元级 不确定性的影响。我们表明,量化会增加低熵符号标记的错误采样,同时导致在高不确定性推理步骤中过度集中于一小部分标记。基于这一观察,我们提出了 \textbf{ReSET},一种基于推理步骤熵的温度缩放方法,该方法在线估计步骤级不确定性并使用 词元级 和步骤级熵信号来调整解码温度。为了解决延迟差距,我们进一步设计了一个 CUDA 核心小 M$ NVFP4 内核,用于延迟关键的自回归解码。在推理基准和模型规模上,ReSET 将 NVFP4 推理精度比 NVFP4 基线提高了 $\sim\!$2 点。我们的 CUDA 核心小型 M$ 内核进一步改进了延迟关键型解码,与 NVFP4 vLLM 相比,内核级加速高达 $2.5\!\times$,而端到端解码加速比 BF16 大约为 $2\!\times$。代码可在 https://github.com/aiha-lab/ReSET 获取。