论文

对称性揭示分层动态:Transformer 如何执行上下文分类

Symmetry Reveals Layerwise Dynamics: How Transformers Perform In-Context Classification

模型评测模型行为与机制分析

摘要

Transformer 可以从一些标记示例中执行上下文分类,但推理时间算法仍然不透明。我们研究硬无边际机制中的多类线性分类,并通过在每一层强制执行特征和标签排列等变性来使计算可识别。这使得可解释性得以实现,同时保持功能等效性并产生高度结构化的权重。从这些模型中,我们提取了显式的深度索引递归:softmax Transformer 内的端到端识别的紧急更新规则,据我们所知,这是同类中的第一个。由混合特征标签 Gram 结构形成的注意力矩阵驱动训练点、标签和测试探针的耦合更新。由此产生的动态实现了几何驱动的算法主题,它可以证明放大类分离并产生稳健的预期类对齐。