论文
给它空间!编码器中位置和语义表示的显式解开
Give it Space! Explicit Disentangling of Positional and Semantic Representations in Encoders
摘要
位置编码(PE)支持排列不变的 Transformer 如何表示序列顺序,但位置信息的处理和存储方式仍然知之甚少。现代 PE 方法(例如 RoPE)仍然在长上下文理解或检索等任务上遇到困难 \cite{chen-etal-2025-hope}。因此,更好地理解内部位置机制有助于设计更好的PE。基于位置和语义信号在经过训练的 Transformer 中占据几乎正交子空间的证据,我们修改编码器 Transformer 来处理三个明确解开的流:语义、绝对位置(AP)和相对位置(RP),并将掩码语言建模(MLM)目标限制在语义流中。这种解耦可以实现清晰的机械研究,并得出三个结论。 (1) 孤立的 AP 子空间自发地塌缩成捕获文档结构的低频二维流形; (2)注意力头专门针对结构和语义导向的群体,而 RP 专门支持后者; (3) 标准位置编码不能稳健地保留宏观结构:RoPE 和 RP 仅对其进行弱编码,而纠缠 AP 在 MLM 压力下在最后层中丢失了它。解开的方法保留了位置编码,从而改进了 Flash-Holmes 探测基准的 65 种语言现象中的 49 种的语言表示。