论文

深度注意力:语言模型的跨层价值混合

Depth-Attention: Cross-Layer Value Mixing for Language Models

模型架构Transformer

摘要

自注意力在序列上自由选择信息,但在深度上,Transformer 只是将每一层的输出添加到残差流中,因此后面的层不能选择性地重用前面层的表示。最近的跨层方法改进了这一流程,但对注意力之外的隐藏状态进行操作,在推理时添加超出键值缓存的状态——随着现代 LLM 使用分组查询和多头潜在注意力压缩缓存,这一成本变得越来越突出。我们引入深度注意力,它在注意力模块本身内部执行此选择:在层关注序列之前,其查询关注同一标记位置的较早层的键,并将它们的值混合到自注意力然后读取的值中。由于深度注意力重用了标准注意力查询、键和值缓存槽,存储深度混合值来代替原始值,因此它不添加任何参数,也不会引入超出标准键值缓存的持久推理状态——与普通解码器相同的缓存大小,并且小于基于隐藏状态的跨层方法。在 1.5B 和 3B 参数的 Qwen3 风格解码器上,深度注意力实现了最低的困惑度和最高的平均下游精度,比普通 Transformer 提高了 2.3 个精度点,并在困惑度和平均精度方面超过了强大的跨层基线,同时增加了 0.01% 的额外算术 FLOPs,并且没有额外的持久推理状态。增益保持从 360M 到 3B 参数,并扩展到循环 Transformer。