论文
第一滴墨水:长上下文推理中误导性信息的非线性影响
The First Drop of Ink: Nonlinear Impact of Misleading Information in Long-Context Reasoning
摘要
随着大语言模型日益部署于检索增强生成以及会累积大量上下文的智能体系统中,理解干扰信息如何影响长上下文性能变得至关重要。已有工作表明,语义相关但具有误导性的文档会降低性能,但干扰项占比与性能之间的定量关系仍未被研究。本文在固定长度的上下文中系统地改变硬干扰项比例,揭示出一个显著的非线性模式:随着硬干扰项比例上升,性能在最初很小的一段区间内急剧下降,而其余区间仅带来边际的额外衰减。我们将这一现象命名为“第一滴墨”(The First Drop of Ink)效应,类比一滴墨即可污染一池水。基于注意力机制的理论与实证分析表明,硬干扰项即使在很小的比例下也会捕获不成比例的注意力,且随着其比例增大,边际影响递减。受控实验进一步表明,过滤带来的收益主要来自上下文长度的缩短而非干扰项的移除;要显著恢复性能需将硬干扰项比例降至接近零,这凸显了上游检索精度的重要性。
