论文

塞壬之歌:近邻背景干扰如何掩盖长上下文中的远处证据

The Sirens' Song: When Proximal Background Context Overshadows Distant Evidence

模型架构Transformer

摘要

长背景大语言模型专注于从广泛的背景中检索遥远的证据,但现有的工作主要集中在克服距离本身。在这项工作中,我们发现了“邻近陷阱”,对远处证据的关注不够,往往不是因为距离本身,而是因为与丰富的、与任务无关的邻近背景的累积竞争。为了解决邻近陷阱,我们引入了 LYRA(长上下文重尾相关性对齐),这是一种 t 分布的定向匹配机制,可以重塑上下文检索分布,将更多注意力集中到与任务相关的证据上,同时保留编码的相对位置信息。 LongBench-v2、RULER 和 LongBench 上的大量实验证明了跨上下文长度和任务类别的一致改进。我们进一步介绍了 ProxBench,这是一个多级细粒度基准,用于评估在增加的近端背景干扰下远程证据的利用率。项目页面:此 https URL