论文

ConSA:通过可学习分配实现混合注意力的可控稀疏性

ConSA: Controllable Sparsity in Hybrid Attention via Learnable Allocation

模型架构模型优化Transformer稀疏化

摘要

结合完全注意力(FA)和滑动窗口注意力(SWA)的混合架构是高效 LLM 推理的有前途的范例。然而,现有方法通常依赖于手工制定的规则或简单的事后启发法进行 FA/SWA 分配,并且对这些设计背后的注意行为提供有限的分析。我们提出了混合注意力中的可控稀疏性(ConSA),这是一个在用户指定的稀疏性目标下学习最佳 FA/SWA 分配的框架。 ConSA 采用 L0 正则化来学习为每个注意单元在 FA 和 SWA 之间进行选择的二进制掩码,而增强拉格朗日约束则在任一层或 KV 头粒度上强制执行目标稀疏性。我们在两个 LLM 上以 0.6B 和 1.7B 等级评估 ConSA。学习分配始终优于基于规则的基线,KV-head-wise 分配比逐层分配产生明显的收益。学习到的模式将 SWA 置于底层,并将 FA 集中到连续的中间层块中,这与基于规则的方法中的均匀交错模式不同。这种结构在模型尺度、稀疏性水平和分配粒度上持续存在,揭示了学习分配背后的内在注意力行为的细粒度范围。