论文
无限上下文的定期 RoPE LLM
Periodic RoPE for Infinite Context LLMs
摘要
处理超长上下文的能力对于 大语言模型 (LLM) 执行长范围任务至关重要。虽然最近的努力已将上下文窗口扩展到 1M 及以上,但当序列长度超过位置编码(例如 RoPE)的预训练范围(即位置耗尽)时,模型性能会下降。必须克服这一基本限制才能实现真正的无限上下文。为了解决这个问题,我们提出了周期性 RoPE (P-RoPE),这是一种旨在避免这种耗尽的位置编码机制。它与滑动窗口注意力(SWA)结合运行,以捕获每个窗口内的局部依赖性和相对位置。然后,该局部层由具有无位置编码 (NoPE) 的全局注意力层进行补充,从而实现整个序列中的无界交互,而无需位置限制。通过堆叠这两种类型的层,该模型不需要位置外推来概括更长的时间,并且理论上支持无限的上下文窗口。实证结果表明,我们的模型 MiniWin 在长上下文效率和稳定性方面优于采用标准 GPT 架构的 MiniMInd。我们的工作提供了一条通向 LLM 的可能途径,具有真正的无限上下文理解。代码可在 \href{https://github.com/Cominder/miniwin}{https://github.com/Cominder/miniwin} 获取。