论文

RoPE 已到了极限?长上下文故障的理论、诊断和缓解

RoPE at the End of Its Rope? Theory, Diagnosis, and Mitigation of Long-Context Failures

模型评测评测方法与指标

摘要

基于 RoPE 的语言模型的长上下文故障可能是由于 RoPE 在维持稳定的词元偏好和区分附近位置之间的内在权衡而引起的。确定要解决哪些弱点以及如何解决,需要在跨上下文长度的训练模型中更精确地描述 RoPE 的行为。我们通过允许跨 RoPE 频率的不相等的查询键尺度解决了先前理论的一个关键限制,这与实际的经验观察非常吻合。我们的理论使单个头部和输入的这两个漏洞都可测量,并量化高频组件如何支持位置敏感性,同时可能破坏语义稳定性。我们还推导出了一个理论上的上下文长度界限,超出该界限,在特定条件下,固定的注意力分数比较不能共同避免语义反转和位置不敏感。在我们新的理论见解的指导下,我们推出了 RoPE Profiler,这是一个轻量级、即插即用的诊断工具包,它通过重用缓存的查询和密钥激活,以零额外的前向传递来增强现有的评估。重用评估期间收集的激活,该工具包几乎不需要任何开销。它用两个诊断分数来补充标准基准分数,揭示语义和位置弱点,并帮助用户优先考虑要解决的方面。至关重要的是,我们对 49 个长上下文任务设置的评估揭示了一种独特的模式,其中推理任务主要受到语义反转的影响,而检索任务主要容易受到位置不敏感的影响。在我们的理论和诊断概况的指导下,有针对性的高频重新调整无需额外训练即可立即获得收益,将 Qwen3-8B 上的任务准确性提高高达 20 个百分点,将 Llama-3.1-8B-Instruct 上的任务准确性提高 25 个百分点。