论文

诊断和减轻长期搜索中的上下文腐烂

Diagnosing and Mitigating Context Rot in Long-horizon Search

模型评测模型行为与机制分析

摘要

随着 大语言模型 (LLM) 越来越多地部署在长范围搜索任务中,广泛的上下文已成为常态。增加上下文长度会降低模型能力(称为上下文腐烂)的担忧已成为这些应用程序中广泛认可的问题。然而,在深度搜索场景中,尚不清楚模型在广泛的背景下实际上如何失败,以及现有方法可以在多大程度上缓解此类失败。通过对三个基准的四个旗舰模型的系统研究,我们发现了一个以前被忽视的现象,我们将其称为过早终止:在广泛的上下文中,模型在耗尽上下文窗口之前很久就放弃或提供不确定的错误答案。通过控制查询难度,我们发现提前终止率与上下文长度正相关。根据这些发现,我们重新审视了减轻上下文腐烂的方法,包括上下文管理和并行采样。对于上下文管理,我们分析了三个类别的七种方法,并表明它们本质上是测试时间扩展策略,可以降低提前终止率以实现更多探索,并且我们进一步为方法选择提供依赖于模型的原则。对于并行采样,我们开发了一种行为感知过滤策略,并观察到三种聚合方法的性能增益为 2.6% 至 4.9%。