论文
并非所有想法都需要 HBM:用于 LLM 推理的语义感知内存层次结构
Not All Thoughts Need HBM: Semantics-Aware Memory Hierarchy for LLM Reasoning
摘要
推理 LLM 会产生数千个思想链词元,其 KV 缓存必须驻留在稀缺的 GPU HBM 中。主要的反应——永久驱逐低重要性的词元——对于推理来说是灾难性的:当一半的缓存被删除时,准确性会下降到 0-2.5%。我们问一个不同的问题:每个词元都必须存在于 HBM 中,还是有些词元可以存在于其他地方?我们引入了语义感知内存层次结构,使用累积注意力评分将标记分为四层:HBM、DDR、压缩和驱逐。低重要性词元被移至 CPU 内存而不是被销毁;在每个注意力步骤之前,它们都会以完全精度预取回来,提供完全相同的项,就好像它们从未离开过 GPU 一样。我们将其形式化为零近似误差卸载,并得出我们的中心发现:准确性仅取决于永久丢弃的词元数量(逐出率),而不取决于 HBM 中剩余的词元数量。 HBM 上的受控 3x3 网格和逐出率在三个模型规模 (7B-32B) 和四个基准上证实了这一点。仅 3% 的逐出,该层次结构在 GSM8K 上保留了 91% 的全缓存精度,在 MATH-500 上保留了 71% (n=200);在 14B 规模下,它与未压缩的基线相匹配(90% 与 86%),同时 HBM 占用率减半。在我们的设置上,R-KV(当前的 SOTA 逐出方法)的头对头复制在可比较的预算下仅达到 0-32%。具有真实 GPU-CPU 数据移动的系统原型表明,这种保存的成本适中(5-7% 的传输开销),并且扩展分析预计在生产批量大小下可节省 2-48 GB HBM。