论文
检索注入推理沙箱:解耦检索与推理能力的基准
Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities
摘要
尽管在现有基准上表现强劲,大语言模型能否对真正新颖的科学信息进行推理仍不清楚。多数评估对端到端RAG流水线打分,推理与检索和工具链选择纠缠在一起,信号还被参数化记忆和开放网络的不稳定性进一步污染。我们提出DeR2,一个受控的深度研究沙箱,在保留深度搜索核心难点(多步综合、去噪和基于证据的结论形成)的同时,隔离基于文档的推理。DeR2通过四种机制把证据获取与推理解耦——仅指令(Instruction-only)、概念(Concepts,无文档的金标概念)、仅相关(Related-only,仅相关文档)和全集(Full-set,相关文档加主题相关干扰项)——产生可解释的机制差距,用以操作化检索损失与推理损失,并支持细粒度错误归因。为防止参数泄露,我们采用两阶段验证:要求模型在无证据时参数化失败,同时确保有金标概念时可解。为保证可复现性,每个实例提供冻结文档库(取自2023-2025年理论论文)以及专家标注的概念和经验证的理由。跨多种最先进基础模型的实验揭示出显著差异与可观提升空间:部分模型表现出模式切换脆弱性,在全集下表现反而不如仅指令;另一些模型则呈现结构性概念误用,能正确说出概念却无法将其作为程序执行。
