论文

分组查询专家:GQA 自注意力专家混合

Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention

摘要

自注意力是 Transformer 性能的核心,并且通常是长上下文长度下 Transformer 最昂贵的部分,因为它的成对词元交互随序列长度呈二次方缩放。标准密集注意力还将同一组注意力头应用于每个词元,无论词元难度或信息内容如何。这种统一的激活可能会浪费计算,特别是当序列变长并且注意力成本迅速增加时。我们提出分组查询专家(GQE),这是分组查询注意力(GQA)之上的专家混合层。在每个 GQA 组中,路由器为每个词元选择 k 个查询头专家,而所有键值 (KV) 头保持密集且不变。因此,GQE 保留了 GQA 的 KV 缓存优势,并且仅减少了活动查询头计算。在 250M 参数规模的固定 30B 词元预算 上,GQE 在下游精度上匹配全活动 GQA 基线,同时激活每个词元的一半查询头。