论文
从检索到的内容中学习:用于语义检索的在线 RL 微调
Learning from What You Retrieve: Online RL Fine-Tuning for Semantic Retrieval
摘要
在大规模电子商务检索中,双编码器 检索器 针对对比相似性进行了优化,而下游重排序器则捕获更细粒度的相关性偏好;这种客观的不匹配限制了端到端的检索质量。强化学习提供了一种使用奖励模型反馈进行 检索器 适应的方法,但我们观察到标准策略梯度更新可能会降低嵌入几何性能,特别是当文档索引由于工业限制而必须保持冻结状态时。为了解决这个问题,我们提出了 PAO(Positive-Advantage-Only),一种选择性 RL 优化方法。我们的分析表明,在冻结的高维空间中对负样本的不加区别的惩罚(推开)会破坏预先训练的语义流形。 PAO 有选择地将梯度更新仅应用于具有积极优势的检索项,有效地将查询嵌入拉向高奖励区域,同时保持全局拓扑稳定性。对大量工业数据集和公共基准的实验表明,PAO 显着优于标准 RL 和 蒸馏 基准。