论文
长上下文的基于内容的寻址
Content-Based Addressing for Long Context
摘要
旋转位置嵌入(RoPE)使用每个标记的整数位置来确定在注意力内部应用的旋转。这对于本地词元顺序很有效,但增加上下文长度会导致位置训练测试不匹配:RoPE 在训练期间未看到的偏移处产生相对旋转。重新缩放、插值、随机化或偏置位置的方法指定注意力如何处理这些偏移,但仍然从不断增长的词元计数器中获取位置信息。相反,我们将词元流划分为多个单元,保留每个单元内的普通 RoPE 位置,并为每个完成的单元分配一个根据其内容计算的地址。添加单元然后将相同的学习映射应用到新内容,而不是扩展位置范围或标识符表。我们证明这种结构准确地保留了局部 RoPE,当插入或重新排序其他单元时,两个固定标记之间的注意力比较保持不变,并且不会仅仅因为添加更多单元而创建新的相对旋转。在字符级 Tiny Shakespeare 诊断中,从 256 到 4096 个字符的上下文,所有标记验证困惑度保持大致恒定。第二个诊断显示基于内容的寻址可以检索和使用来自多个序列化事实的信息。这些是受控的浅层实验,而不是规模基准,但它们支持直接处方:使用位置来解决本地问题,使用内容来解决跨单元问题。