论文
Transformer 中的距离泛化:为什么要费心使用位置编码?
Distance generalization in transformers: why bother with positional encoding?
摘要
分布外长度泛化,即从短上下文推断任务到长上下文,已针对 Transformer 进行了深入研究。在这里,我们关注距离泛化,它在训练和推理之间改变标记间距离时探测性能,同时保持固定的上下文长度。我们构建了两个合成延迟复制任务,都涉及源和召回之间的有限距离,其中词元被完全或选择性地复制,并测试训练期间未见的延迟的模型。我们解决三个问题:(A) 相对于无位置编码 (NoPE) 而言,RoPE 和 ALiBi 等位置编码方案是否能提高距离分辨率? (B) 数据多样性(训练中出现的标记间距离的数量)如何影响性能? (C) 远程迁移学习什么时候是积极的还是消极的?我们进行了彻底的调查,发现提高我们对潜在机制的理解至关重要。