论文

1M-token上下文窗口中的检索与多跳推理:以中文古典文本评测LLM

Retrieval and Multi-Hop Reasoning in 1M-Token Context Windows: Evaluating LLMs on Classical Chinese Text

模型评测上下文与知识上下文工程模型能力评测

摘要

我们在中文古典语料上评估五个宣称具备1M-token上下文窗口的前沿大语言模型的长上下文检索与推理能力。报告两项互补研究。测试1测量1M token输入下的单针检索:在三个深度植入三根传记「针」,并配置真实(与训练先验一致)与篡改(与训练先验矛盾)两种变体,以区分真正的上下文检索与对训练数据的记忆依赖。测试2为后续实验,考察当检索需要中间推理时长上下文能力是否退化,测量三个上下文档(256K、512K与1M token)下的三跳链遍历。我们发现:对最强模型而言,1M下单针检索已基本解决——Gemini 3.1 Pro、Claude Opus 4.7与GPT-5.5均达100%;但多跳性能呈三种不同的衰减特征:稳定型(Gemini Pro、Claude)在512K内保持80%以上准确率、1M处轻度退化;晚崖型(GPT-5.5、Qwen3.6-plus)在512K到1M之间骤然坍塌;平滑下降型(DeepSeek V4 Pro)在整个范围内渐进衰减。结果提示:标称上下文窗口长度并不能很好代理可用的长上下文多跳能力,而当前1M上下文旗舰模型之间最锐利的判别点是512K到1M的过渡区。

1M-token上下文窗口中的检索与多跳推理:以中文古典文本评测LLM:论文配图
图 1:测试 1 原理图。单个传记事实被植入每个模型的大海捞针中的三个深度之一(25%、50%、75%),其大小为每个模型 1M 令牌上下文窗口的 ∼\sim99%。然后向模型提出一个问题,其答案仅取决于植入的陈述。