论文

规范化或本地化:当训练时 KV 缓存几何结构在量化下获得回报时

Regularize or Localize: When Training-Time KV-Cache Geometry Pays Under Quantization

模型推理KV Cache

摘要

我们研究了 \sigreg(LeJEPA 的反崩溃目标)是否可以在标准自回归语言模型预训练期间重塑表示,以及何时生成的几何有助于 \kv 缓存量化。我们在 10B FineWeb 词元上训练 1.1 亿参数模型,并报告了三项发现。 \textbf{(1)} 在 $λ{=}0.01$ 处,\sigreg 将三对种子的隐藏状态成对余弦各向异性降低了 $38\%$。每对的困惑度增加不到 $0.35\%$,并且没有一致的零样本损失。 \textbf{(2)} 此更改不会从隐藏状态传播到 \kv 缓存。然而,在继续训练期间将 \sigreg 直接应用于 K 和 V,可以将四个检查点的平均缓存各向异性减少 $94\%$。没有 \kv 项的匹配延续使缓存几何结构几乎不变,并且我们测试的冻结主干改造不会重现效果。 \textbf{(3)} 在未变换的对称无组量化下,直接 \kv 正则化是唯一在所有三个种子中更喜欢每通道缩放的训练条件,并且在相同的 3 位每通道方案下,基线会产生 $4.3$--$7.9\times$ 直接正则化模型的 \dnll。然而,在完全模拟的 KIVI 式配置(混合排列、零点、分组尺度)下,所有模型都达到接近同等的水平,包括存储开销近似匹配时。在这个 110M 机制中,当量化器尺度较粗时,训练干预会有所帮助;在词元本地分组、混合 kv 缩放和零点的测试组合下,优势消失了。据我们所知,这是针对事后缓存量化评估的标准 kv 缓存几何结构的第一个训练时 \emph{分布} 正则化。