论文
用于注意力的哈斯图:用于设计 Transformer 掩模的偏序框架
Hasse Diagrams for Attention: A Partial Order Framework for Designing Transformer Masks
摘要
在大型 Transformer 模型的训练过程中,注意力掩模调节序列中信息流的范围和方向。存在许多掩码变体,并且 FlexAttention 等运算符已经支持任意注意掩码。然而,缺少对任意掩码引起的信息流结构的系统形式分析。本文构建了一个完整的理论框架。我们证明,在足够的深度下,多层 Transformer 的信息流收敛到哈斯图——表示偏序的有向无环图。在此基础上,我们将并行训练任务的设计重新定义为寻找哈斯图的最小公共超图的问题,并建立了最小公共超图的标准。这产生了一种直接从一系列任务中导出注意力掩模的建设性方法。应用该框架,我们设计了两种新颖的掩模:确保训练推理一致性的块生成注意掩模(块双流注意)和完全监督的双向注意掩模(蝴蝶注意)。这些结果证明了该框架发现新结构的能力。