论文

两者相匹配:通过强化学习共同进化生成 检索器

It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning

模型训练强化学习

摘要

检索是现代搜索和广告系统的第一阶段,从大量项目中选择候选集进行下游排名和拍卖。最近的工作越来越多地利用 LLM 通过查询扩展、数据合成和检索反馈训练来改进检索。然而,生成组件通常用于查询端增强,而最终匹配仍然委托给下游 检索器。我们引入了 CoGR,一个检索框架,它训练 LLM 直接在查询和项目端构建检索表示。每个生成器都会生成一组紧凑的关键字,这些关键字直接通过倒排索引进行匹配,从而保持与现有基于关键字的检索基础设施的兼容性。 CoGR 使用两阶段训练管道。受监督的 微调 首先建立一个对齐的关键字空间,然后共同进化强化学习使用 GRPO 针对另一侧的冻结索引交替优化查询侧和项目侧生成器。双方都优化相同的查询到项目检索 $F_1$ 目标:查询方直接接收检索 $F_1$,而项目方接收反事实边际奖励,衡量由其生成的关键字引起的查询方 $F_1$ 的变化。在 10 个代表性的稀疏、密集和生成基线中,CoGR 在内部 APP Marketplace 数据集和公共 WANDS 基准上均实现了最佳性能,与最强基线相比,$F_1$ 分别提高了 $10.9\%$ 和 $36.1\%$。进一步的分析显示了训练中稳定的协同进化和日益一致的查询项关键字空间。