论文
前沿语言模型难以复制:可以更好地以 2D 方式查看文本
Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D
摘要
虽然 大语言模型 (LLM) 可以在几秒钟内解决高级推理问题,但我们表明,即使是前沿模型也无法执行更简单的操作:精确复制位于其上下文窗口内的输入字符串。我们将这种失败归因于 Transformer 架构中的位置编码,其归纳偏差倾向于通过基于匹配本地上下文的快捷方式进行复制,而不是仔细定位相应的输入位置。为了解决这个问题,我们引入了 2D-RoPE,它将文本组织成 2D 网格而不是 1D 序列,并为每个标记分配一个行 ID 和一个列 ID。在这种视图下,复制变得只是在固定的列偏移处检索输入标记,这使得该任务易于学习。在合成复制实验中,使用 2D-RoPE 的浅层 Transformer 在输入长度比训练期间长数百倍的情况下实现了完美复制,而标准位置编码则远远落后。我们进一步表明,2D-RoPE 语言模型在复制任务上的优势在模型大小高达 1.4B 参数的 DCLM 上的大规模预训练中始终保持不变。总的来说,我们的结果表明,以 2D 方式查看文本有利于语言建模,我们希望这能鼓励未来的工作,进一步探索 2D 位置编码的潜力。