论文

意见领袖动态:稀疏注意力如何塑造词元聚类

Opinion Leader Dynamics: How Sparse Attention Shapes Token Clustering

模型评测模型行为与机制分析

摘要

稀疏注意力降低了全局自注意力的二次成本,同时保留了强大的经验表现,但其有限的相互作用如何塑造词元表示的演化在理论上仍然没有得到充分探索。将词元建模为单位球体上的粒子,我们引入了意见领袖动力学,这是一个框架,该框架识别了两种机制,通过这两种机制,词元组在内部聚合,同时保持不同的限制方向。在显式模型中,固定代表会产生一种势能,将词元吸引到不同的局部最大值。在隐式模型中,互不相连的互动群体朝着不同的共识方向发展。我们将这两个模型都表示为反向 Wasserstein 梯度流,并在适当的条件下建立指数收敛。我们进一步将这些理论预测与前沿稀疏注意力大语言模型中的词元演化联系起来,从而激发了我们的框架。在四个基准测试中,Kimi-K3、MiniMax-M3 和 DeepSeek-V4-Flash 在预测词元表示中始终表现出比密集注意力模型 GLM-4.7-Flash 更清晰的聚类分离和更高的聚类分数。这些观察结果支持预测的多组结构与经过训练的前沿 LLM 的相关性,而有限粒子模拟说明了理论收敛行为。总之,我们的结果将受限的词元交互与不同的组级吸引子联系起来,提供了一个动态说明,说明稀疏注意力如何支持组内对齐,同时保持组之间的分离。