论文
通过基于向量索引的输出嵌入加速 LLM 推理
Accelerating LLM Inference via Vector Index Based Output Embeddings
摘要
大型输出嵌入矩阵在自回归解码期间会产生显着的内存带宽瓶颈,特别是对于具有大型多语言词汇表的紧凑型 LLM。我们重新制定输出投影,然后选择前 k 个标记作为对标记嵌入的最大内积搜索,并用基于 HNSW 的向量索引替换密集词汇投影。生成的输出头仅检索一小部分高分标记的候选集,并且可以通过将检索到的 logits 分散到稀疏的全词汇张量中来集成到现有的解码管道中。在使用 Gemma 3、Llama 3.2 和 Qwen 3 模型进行 CPU 推理时,我们的方法极大地加速了输出投影,并将 Gemma 3 270M 的端到端批量大小一解码吞吐量提高了高达 82%,同时在 AlpacaEval 评估下保持了生成质量。这些结果表明,近似检索是延迟敏感小批量解码中密集输出投影的实用替代方案。