论文

HLA:通过按块动态混合增强混合线性注意力

HLA: Expressive Hybrid Linear Attention via Chunk-Wise Dynamic Mixing

模型架构混合架构

摘要

线性注意力通过把历史压缩到循环状态,实现高效的长上下文自回归解码,但这种压缩可能妨碍选择性访问稀疏、远距离信息。现有按块扩展增大了记忆容量,但学得的块混合系数可能不随输入内容改变,无法针对每个查询调整历史访问。我们提出 Hybrid Linear Attention(HLA),一种用于 Gated DeltaNet(GDN)、依赖查询的块级注意力机制。HLA 将每个已完成块表示为精确的仿射状态转移,通过紧凑的自注意力池化代表计算内容相关路由门。每个门在对应历史转移与恒等映射之间插值,同时控制该块的加性记忆以及对更早状态的变换。有效支撑正则化进一步鼓励集中路由,以实现稀疏推理。我们分别通过预训练模型适配和从头训练评估 HLA。在 0.8B—9B 的 Qwen3.5 模型上,HLA 稳定优于原生 GDN 与固定块混合,LongBench-V2 最高提高 5.57 个百分点,RULER 最高提高 3.97 个百分点。在受控的从头训练设置中,1.3B 模型以 4K 上下文训练 100B token 后,HLA 也提高了 4K—32K 的 RULER 表现,收益从 4K 的 0.83 个百分点增长到 32K 的 4.22 个百分点。结果说明,按查询组合循环记忆能够改善长上下文建模;使用紧凑的逐块仿射摘要时,在训练上下文之外仍然有效。项目页面:https://caesarhhh.github.io/hla/

HLA:通过按块动态混合增强混合线性注意力的原论文方法或结果图
图 6:跨上下文长度和相对证据位置的检索性能。每个单元格报告按证据到查询距离分组的示例的 RULER S1 检索分数,作为提示长度的一部分。左:原生 GDN。右:HLA。随着上下文长度的增加,HLA 对远处证据的检索性能显着提高。