论文

DAMP:衰减感知混合精度循环状态量化

DAMP: Decay-Aware Mixed-Precision Recurrent-State Quantization

摘要

Softmax 注意力存储每个前面标记的键和值向量,导致推理内存随着序列长度而增长。最近结合了 Gated DeltaNet (GDN) 或 Kimi Delta Attention (KDA) 的语言模型通过用固定大小的循环状态替换大多数层中的 KV 缓存来降低这种成本。然而,这些循环状态通常存储在 FP32 中并消耗大量 GPU 内存;它们的更新受到内存带宽的限制,并且会显着增加解码延迟。据我们所知,我们是第一个研究基于 GDN 和 KDA 的语言模型中循环状态的 后训练 量化的人。我们发现统一量化的准确性较差——存储权衡:INT8 和 FP8 已经降低了复杂推理任务的准确性,而 INT4 和 NVFP4 将其降低到接近于零。我们进一步发现,大多数量化误差能量集中在一小部分通道中,并且状态通道的相对衰减强度在提示和任务中保持稳定。受这些发现的启发,DAMP 使用量化误差能量和基于衰减的持久性来识别离线校准期间的高风险通道。它以更高的精度存储这些通道,并将其余部分存储在 INT8 中。我们在 Qwen3.6-35B 和 Kimi-Linear-48B 上通过涵盖数学推理、一般推理和代码生成的六个基准测试来评估 DAMP。在每个状态值 9.9 位时,DAMP 保持接近 FP32 基线的平均精度。 DAMP 将循环状态存储减少 69.1%,将循环状态更新内核加速高达 2.01 倍,并将全模型 TPOT 降低高达 10.9%。