论文

识别干扰项的截断:区分长上下文基准中的长度效应与信号丢失

Distractor-Aware Truncation: Disentangling Context-Length Effects from Signal Loss in Long-Context LLM Benchmarks

模型评测上下文与知识上下文工程评测方法与指标

摘要

检索增强与记忆增强语言模型研究常声称,只要保留相关信息,较短的上下文就更好。作者在BABILong和GraphWalks(BFS)两个长上下文基准的每个样本上,测试100%、75%、50%、25%四种上下文保留比例,并比较两种截断方式:直接删除提示中间部分,以及先识别任务相关内容、只删除干扰内容。评估涵盖Claude的Haiku 4.5、Sonnet 4.6、Opus 4.7和另一供应商的GPT-5.5,另在MRCR v2和Oolong上应用相同流程。直接截断时,分数随保留比例降低而单调崩落;BABILong和GraphWalks的八组条件中,配对Wilcoxon检验经Holm校正后p_adj均小于0.05。保留任务信号时,表现保持或提升:较小的两个Claude模型在BABILong上显著改善,Opus 4.7和GPT-5.5则达到其全上下文表现上限。GPT-5.5也复现了直接截断的崩落及保留信号后的恢复,排除了单一供应商的影响。机制很直接:保留25%上下文时,直接截断后不到1%的样本仍包含答案信息;另一种协议则从设计上保留答案信息。因此,直接删除中间内容测量的不是上下文窗口效应,而是删除过程碰巧留下答案的频率。今后的上下文长度研究必须明确说明如何区分任务信号与干扰内容,否则结论可能混淆两种相反的解释。

识别干扰项的截断:区分长上下文基准中的长度效应与信号丢失:论文配图
图 1:BABILong:按协议和模型划分的分数与上下文保留。每个面板都是一个截断协议(左:朴素的中间删除;右:干扰感知)。每条线都是一个模型;阴影条带是每个单元 n=240n=240 个样本上的配对引导 95% CI(5,000 个引导重新采样,种子 42)。协议引起的符号翻转是核心发现:在朴素截断下,每个模型都显示出单调崩溃;在干扰感知截断下,具有相同标称上下文分数的相同模型是平坦的(Opus 和 GPT-5.5,在天花板上)或正倾斜的(Haiku、Sonnet)。