论文
自注意力逆温度关键缩放的统一框架
A Unified Framework for Critical Scaling of Inverse Temperature in Self-Attention
摘要
长度相关的 logits 重新缩放被广泛用于稳定长上下文自注意力,但现有的分析和方法表明,上下文长度 $n$ 的逆温度定律相互冲突,范围从 $(\log n)^{1/2}$ 到 $\log n$ 和 $(\log n)^2$。我们提供了一个一般理论,表明理想的规模是由每个关注行的间隙计数函数 $N_n$ 决定的。计算每个差距内距离最大值有多少竞争对手,我们定义了一个上尾积累尺度,并证明它给出了 softmax 浓度的临界逆温度尺度:低于这个尺度,顶级竞争对手保持不分离,而高于这个尺度,注意力熵崩溃。该框架将先前的缩放法则统一为不同的 $N_n$,并为注意力评分系列提供直接诊断,从理想化的理论模型到更实用的 Transformer。