为什么Gated DeltaNet能承受4位量化:混合27B大语言模型循环部分的NVFP4 W4A4
Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM
摘要
混合 LLM 将 softmax 注意力与线性注意力层(例如门控 DeltaNet (GDN))配对,其循环状态以固定大小总结上下文。 Qwen3.8-27B 的早期社区 4 位量化(48 个 GDN 层,16 个注意力层)将 GDN 块保留为 8 位或 16 位精度——尤其是其衰减和写入强度门——直觉上循环中的错误会在长上下文中累积。我们通过在所有 496 个线性层(包括 GDN)上构建最小值:NVFP4 W4A4 来测试这种直觉。跨越 4K/32K、MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench 和 RULER 检索到 64K 的困惑度,Minima 在种子噪声(5 任务平均值 -0.52)内与 BF16 匹配,同时是我们比较的最小(17.5 GiB)和最快预填充(+14-19%)配方,其 32K 困惑度差距随位置缩小。一项由四部分组成的机制研究解释了原因:(i) NVFP4 的 16 元素块缩放定位了残差流的极端异常值,均衡了各层角色的激活误差; (ii) 所谓脆弱的门投影是最不敏感的——softplus/指数和 sigmoid 参数化将 ~11% GEMM 误差压缩到 ~2% 输出误差; (iii) delta 规则递归将注入的噪声保持在超过 32K 个令牌的平坦平台,并在数百步内忘记状态脉冲,因为每次写入都会沿当前关键方向覆盖状态; (iv) 每个令牌的量化成本随着上下文而不是复合而消失。我们还修复了当每个模块校准的 NVFP4 检查点由将这些模块融合到一个 GEMM 的内核提供服务时出现的全局规模不匹配,并显示校准的 FP8 KV 缓存规模与性能无关。结果是:一个实用的秘诀——量化一切,船舶 KV 尺度——以及为什么混合 LLM 的循环一半是容易量化的一半的机械解释。检查点:https://huggingface.co/minima-ai/mnma_qwen3.8_27b_nvfp4