论文

无密钥注意:价值空间路由和仅价值缓存,实现高效 Transformer

Keyless Attention: Value-Space Routing and Value-Only Caching for Efficient Transformers

模型架构Transformer

摘要

Transformer 架构构成了现代自然语言处理的基础,但键值 (KV) 缓存在长上下文生成过程中引入了大量内存和带宽开销,日益成为大规模部署的瓶颈。我们提出了 Keyless Attention,这是一种新颖的注意力机制,用专用的值空间路由投影取代传统的键投影,完全消除注意力计算中的键表示,并产生仅值缓存,将 KV 缓存减少 50%,同时提高解码吞吐量。跨多个模型和架构的实验表明,Keyless Attention 实现了与标准 QKV Attention 相当的困惑度和下游任务性能,同时持续将 KV 缓存内存减少 50%。此外,无钥匙注意在最佳时期之后表现出较慢的验证损失退化,表明针对过度拟合的鲁棒性有所提高。消融研究证实,专用的价值空间路由投影至关重要,无密钥注意力机制优于 KV 共享方法,后者消除了密钥缓存而不取代其路由角色。预训练体系中的实验进一步证实了无钥匙注意在工业环境中的可行性。