论文
AXELRAM:量化一次,永不反量化
AXELRAM: Quantize Once, Never Dequantize
摘要
我们提出了 AXELRAM,这是一种智能 SRAM 宏架构,可以直接从量化的 KV 缓存索引计算注意力分数,无需反量化。关键推动因素是设计时固定码本:基于正交变换的量化将每个坐标的分布集中到 N(0,1/d),因此最佳量化器仅取决于维度 d 和位宽 b,而不取决于输入数据。非对称路径设计——写入时变换,读取时查表,没有逆变换——将每个查询的乘法减少了 102.4 倍(数学恒等式)。通过多种子评估(10 个种子 x 3 个模型),我们发现符号模式敏感性会在某些模型 (Qwen2.5-3B) 上导致灾难性的 PPL 峰值 (Delta > 50),而其他模型 (LLaMA-3.1-8B) 则完全稳定。这种现象将 SpinQuant 对权重量化中旋转方差的观察扩展到 KV 缓存域,该域的影响在质量上更为严重。我们追踪分层范数异质性的根本原因,并提出一种无梯度符号模式选择(200 个候选,8 个校准样本,一次性),以零额外硬件成本消除灾难性尖峰。所有源代码均可在 https://github.com/Axelidea/AXELRAM 获取。