论文

重新思考推理密集型检索:在代理搜索系统中评估和推进 检索器

Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems

模型评测基准与评测资源

摘要

推理密集型检索旨在找出支持下游推理的证据,而不仅仅是匹配主题相似性。此功能对于代理搜索系统越来越重要,检索器 必须在迭代搜索和综合中提供补充证据。然而,现有的工作在评估和训练方面仍然有限:BRIGHT 等基准提供了狭窄的黄金集并单独评估 检索器,而综合训练语料库通常优化单通道相关性而不是证据组合构建。我们推出了 BRIGHT-Pro,这是一个专家注释的基准测试,它通过多方面的黄金证据扩展每个查询,并在静态和代理搜索协议下评估 检索器。我们进一步构建了 RTriever-Synth,一个方面分解的合成语料库,可生成互补的正例和正条件硬负例,并用它来 LoRA 从 Qwen3-Embedding-4B 微调 RTriever-4B。词汇、通用和推理密集型 检索器 的实验表明,方面感知和代理评估暴露了标准指标隐藏的行为,而 RTriever-4B 比其基本模型有了显着改进。