论文
1M-token上下文窗口中的检索与多跳推理:以中文古典文本评测LLM
Retrieval and Multi-Hop Reasoning in 1M-Token Context Windows: Evaluating LLMs on Classical Chinese Text
摘要
我们在中文古典语料上评估五个宣称具备1M-token上下文窗口的前沿大语言模型的长上下文检索与推理能力。报告两项互补研究。测试1测量1M token输入下的单针检索:在三个深度植入三根传记「针」,并配置真实(与训练先验一致)与篡改(与训练先验矛盾)两种变体,以区分真正的上下文检索与对训练数据的记忆依赖。测试2为后续实验,考察当检索需要中间推理时长上下文能力是否退化,测量三个上下文档(256K、512K与1M token)下的三跳链遍历。我们发现:对最强模型而言,1M下单针检索已基本解决——Gemini 3.1 Pro、Claude Opus 4.7与GPT-5.5均达100%;但多跳性能呈三种不同的衰减特征:稳定型(Gemini Pro、Claude)在512K内保持80%以上准确率、1M处轻度退化;晚崖型(GPT-5.5、Qwen3.6-plus)在512K到1M之间骤然坍塌;平滑下降型(DeepSeek V4 Pro)在整个范围内渐进衰减。结果提示:标称上下文窗口长度并不能很好代理可用的长上下文多跳能力,而当前1M上下文旗舰模型之间最锐利的判别点是512K到1M的过渡区。
