论文
当学习上下文规划无法击败强检索时:针对长上下文 QA 的规划、路由和重排序的受控研究
When Learned Context Planning Fails to Beat Strong Retrieval: A Controlled Study of Planning, Routing, and Reranking for Long-Context QA
摘要
学习上下文规划在答案模型对证据原子进行推理之前选择证据原子。我们测试在强大的检索、路由、预算选择器和重新排名控制后,这种学习选择是否可以改善长上下文多项选择 QA。我们的主要诊断使用 Qwen2.5-7B-Instruct 的所有 503 个 LongBench-v2 MCQ 问题。规划器经过 SFT 训练,针对来自 140 个训练和 28 个发展问题的结果选择轨迹进行了训练;由于 503 个问题的分析包含这些问题,因此它具有部分转导性。在 18k 字符预算下,锚定混合检索的准确率达到 36.18%,BM25 达到 35.98%,而最佳直接规划器引导方法达到 34.19%。在未受影响的 152 个问题测试中,锚定混合仍然较高(42.11% 对 36.84%)。泄漏安全路由器无法转换较大的预言机间隙。在预算紧张的情况下,最好的规划者在 6k 时仅领先 0.40 分,在 9k 时失败;计划者引导的重新排名在 6k 处具有 +1.79 点的估计值,并且配对间隔过零,并在 9k 处与控制相平。包装顺序和分数平坦度分析没有确定稳定的机制。在这种设置下,学习规划是一种弱相关信号,而不是强检索的替代品。