论文

自适应头部预算可实现高效的多头注意力

Adaptive Head Budgeting for Efficient Multi-Head Attention

模型架构Transformer

摘要

多头注意力使 Transformer 能够捕获不同的表示,但无论任务复杂程度如何,所有注意力头通常都会针对每个输入激活。对于文本分类等粗粒度任务,相关信息通常是全局的,这种固定分配可能会引入不必要的计算。我们提出了 BudgetFormer,这是一种 Transformer 架构,可以根据每个输入动态分配注意力头。该模型学习头部预算和相关性分布,以选择信息最丰富的头部。为了支持有效的头部选择,我们引入了平衡探索和利用的训练策略。文本分类任务的实验表明,BudgetFormer 减少了 FLOP 和内存使用,同时匹配或超越了标准多头注意力的性能。这些结果凸显了自适应磁头分配是提高 Transformer 效率和性能的有效方法。