论文
Critic-R:使用经过指令调整的 检索器 和自然语言内省反馈来改进代理搜索
Critic-R: Improving Agentic Search using Instruction-tuned Retrievers with Natural Language Introspective Feedback
摘要
代理搜索系统与检索模型迭代交互以回答复杂的查询。尽管取得了实质性进展,但针对代理搜索优化 检索器 仍然具有挑战性,通常需要大量协同训练或限制现实世界适用性的黄金标准注释。我们提出了 Critic-R,一个在推理和训练过程中明确关闭推理代理和检索模型之间的反馈循环的框架。 Critic-R 引入了批评者模型,该模型在消耗检索到的证据后评估代理的内省推理轨迹,以确定检索到的上下文是否足以支持下一个推理步骤。 Critic-R 有两种互补机制:Critic-R-Zero,一种推理时间查询细化循环,迭代地重写查询和检索指令;Critic-Embed,一种检索模型的优化方法,利用成功和失败的细化轨迹作为自动监督,无需手动相关性注释。我们在 HotpotQA、2WikiMultihopQA、MuSiQue 和 Bamboogle 上评估 Critic-R。结果表明,Critic-R 显着提高了检索质量和下游答案准确性。