论文
学习从智能体轨迹中检索
Learning to Retrieve from Agent Trajectories
摘要
信息检索(IR)系统传统上是为人类用户设计和训练的,学习排名方法严重依赖大规模的人类交互日志,例如点击和停留时间。然而,随着 大语言模型 (LLM) 支持的搜索代理的迅速出现,检索越来越多地被代理而不是人类所使用,并且作为核心组件嵌入到多轮推理和动作循环中。在这种情况下,在以人为中心的假设下训练的检索模型与代理发出查询和使用结果的方式表现出根本的不匹配。在这项工作中,我们认为代理搜索的检索模型应该直接从代理交互数据中进行训练。我们引入从智能体轨迹中检索的学习作为一种新的训练范式,其中监督源自多步智能体交互。通过对搜索代理轨迹的系统分析,我们识别了揭示文档效用的关键行为信号,包括浏览操作、未浏览的拒绝和浏览后推理痕迹。在这些见解的指导下,我们提出了 LRAT,这是一个简单而有效的框架,可以从智能体轨迹中挖掘高质量的检索监督,并通过加权优化合并相关性强度。对域内和域外深度研究基准的大量实验表明,使用 LRAT 训练的 检索器 能够持续提高跨不同代理架构和规模的证据召回、端到端任务成功率和执行效率。我们的结果强调了代理轨迹作为一种实用且可扩展的监督源,为代理搜索时代的检索指明了一个有前途的方向。