论文

Transformer 的熵界:为什么静态排名失败而注意力原生排名恢复

The Entropic Bound for Transformers: Why Static Rank Fails and Attention-Native Rank Recovers

模型评测模型行为与机制分析

摘要

神经缩放定律描述了损失如何随着模型、数据和计算的增长而减少,但它们没有回答先前的问题:对于固定任务,解决它所需的最小模型容量是多少?我们通过熵界(Entropic Bound)来研究这一点,熵界是 Transformer 任务内在能力的谱概念。我们首先证明,在线性注意力代理中,词元混合算子的内在等级 $r^*$ 是一个严格的下界:任何等级不足的模型都会产生不可避免的过度风险,并且该界限可以在 $r^*$ 处实现。我们进一步表明,梯度下降在标准低秩隐式偏差假设下恢复了该秩,凭经验确认了所有三个属性,并表明 $r^*$ 可以从训练前的数据中恢复。然后我们问这是否会转移到真正的注意力上。朴素的转移失败了,受控的插值梯子精确地定位了原因:它不是 softmax 也不是等级约束,而是注意力混合算子的输入条件性质,这是静态权重内核无法概括的。受此启发,我们引入了一种注意力原生内在排序——在注意力类中实现任务的最小查询关键内核排序——并表明,在这个定义下,线性和softmax注意力都恢复了完整的熵界限结构(缺陷、可实现性、恢复),并且能量有效排序作为对softmax失真鲁棒的估计器。最后,我们映射了纯数据可预测性的边界:即使没有大规模的值图,$r^*$ 对于线性 QK 注意力来说也是完全可恢复的,而 softmax 注意力由于非线性反转和核值可识别性效应,只允许部分 预训练 恢复。我们的结果将熵界从事后描述符重新构建为具有精确表征的可预测性边界的注意力原生能力度量。