论文
推理期间何时检索:大型推理模型的自适应检索
When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models
摘要
DeepSeek-R1 和 OpenAI o1 等大型推理模型生成了跨越数千个词元的扩展思想链,但它们与检索增强生成 (RAG) 的集成仍然从根本上错位。当前的 RAG 系统针对在推理开始之前提供上下文进行了优化,而推理模型则需要在多步推理链期间注入证据。我们引入了 ReaLM-Retrieve,这是一种推理感知检索框架,它通过三个关键创新解决了这种不匹配问题:(1)步骤级不确定性检测器,可以在推理步骤粒度而不是标记或句子级别识别知识差距; (2) 检索干预策略,用于了解外部证据何时最有利于持续推理; (3) 效率优化的集成机制,与简单集成相比,每次检索的开销减少了 3.2 倍。 MuSiQue、HotpotQA 和 2WikiMultiHopQA 上的实验表明,与标准 RAG 相比,ReaLM-Retrieve 在答案 F1 上实现了平均 10.1% 的绝对改进(范围:三个基准中的 9.0-11.8%),同时与 IRCoT 等固定间隔方法相比,检索调用减少了 47%(所有改进均在 p<0.01 时显着,配对引导)。在需要 2-4 跳推理的具有挑战性的 MuSiQue 基准测试中,我们的方法实现了 71.2% F1,平均每个问题仅 1.8 次检索调用。分析表明,ReaLM-Retrieve 还提高了检索质量本身,实现了 81.3% 的 Recall@5,在支持证据方面始终比固定间隔基线更高的精度和 MRR,为推理密集型检索任务建立了新的最先进的效率与准确性权衡。