论文
Softmax 抛弃了什么:证据积累的大众意识注意力
What Softmax Throws Away: Mass-Aware Attention for Evidence Accumulation
摘要
高任务性能并不表明模型是否在其内部表示中保留了与预测相关的结构信息。例如,时态图模型可以实现较高的未来链接 AUC,而基本图统计数据仍然难以从相同的表示中恢复。我们在标准注意力使用的加权平均中确定了这种差距的一个来源:当重复证据模式时,分子和分母以相同的速率增长,因此具有不同数量的累积证据的输入可以产生相同的总量。我们提出了 Mass-Aware Attention (MAA),它将标准 L1 归一化推广到 Lp 系列。在重复下,MAA 使分子和分母以不同的比率缩放,从而保留表示量级中贡献输入的有效数量。它不添加监督、参数、隐藏维度或显式计数特征,并在 p=1 时恢复标准注意力。在四个连续时间动态图模型和三个数据集中,MAA 改进了 12 个模型数据集单元中的 11 个中的未来链接 AUC。来自相同隐藏表示的线性恢复平均增加了 4.49%,并且在族明智校正后,所有 12 个单元的优先附着恢复均得到改善。我们还在标记时间点过程、时间知识图、检索增强生成和时空点过程中观察到一致的证据。信息可访问性和任务实用性仍然不同:NLL 在 MTPP 中得到改进,排名在 TKG 中很大程度上保留,RAG 中的附加信息不会改进诊断头,下游 LayerNorm 可以擦除 STPP 中的信号。这些结果将 MAA 定位为一种通用归一化原则,用于通过控制标准注意力中的重复不变性来提高面向预测者的表示信息量。