论文
识别干扰项的截断:区分长上下文基准中的长度效应与信号丢失
Distractor-Aware Truncation: Disentangling Context-Length Effects from Signal Loss in Long-Context LLM Benchmarks
摘要
检索增强与记忆增强语言模型研究常声称,只要保留相关信息,较短的上下文就更好。作者在BABILong和GraphWalks(BFS)两个长上下文基准的每个样本上,测试100%、75%、50%、25%四种上下文保留比例,并比较两种截断方式:直接删除提示中间部分,以及先识别任务相关内容、只删除干扰内容。评估涵盖Claude的Haiku 4.5、Sonnet 4.6、Opus 4.7和另一供应商的GPT-5.5,另在MRCR v2和Oolong上应用相同流程。直接截断时,分数随保留比例降低而单调崩落;BABILong和GraphWalks的八组条件中,配对Wilcoxon检验经Holm校正后p_adj均小于0.05。保留任务信号时,表现保持或提升:较小的两个Claude模型在BABILong上显著改善,Opus 4.7和GPT-5.5则达到其全上下文表现上限。GPT-5.5也复现了直接截断的崩落及保留信号后的恢复,排除了单一供应商的影响。机制很直接:保留25%上下文时,直接截断后不到1%的样本仍包含答案信息;另一种协议则从设计上保留答案信息。因此,直接删除中间内容测量的不是上下文窗口效应,而是删除过程碰巧留下答案的频率。今后的上下文长度研究必须明确说明如何区分任务信号与干扰内容,否则结论可能混淆两种相反的解释。
