论文

分散注意力的联系

The Diffusion-Attention Connection

模型评测模型行为与机制分析

摘要

Softmax 注意力是扩散图的行归一化算子:两者都将学习分数归一化为马尔可夫算子,并且仅在分数允许包含的内容上有所不同。分解该分数揭示了三个几何扇区:具有维滕-拉普拉斯连续统极限的度量核心,对应于马尔可夫-维滕测量变化的精确节点势扇区,以及实现为不可逆马尔可夫-吉尔萨诺夫输运或磁$U(1)$相的循环扇区。因此,注意力在熟悉的数学中变得可审计:每个受过训练的头脑都带有可测量的几何形状、电势和通量,而标准机制则获取几何地址——Coifman——Lafon归一化作为精确的密度校正,旋转嵌入作为纯规范,AdaLN作为柯西——格林变形与威滕变形相结合。预训练扩散 Transformer 和语言模型的实验测试了这种分解:强制正半定几何几乎是免费的,与识别一致,而消除循环会产生巨大的成本,在归纳中最为明显。