论文
RELER:在嵌入空间用强化学习训练检索
Learning to Retrieve via Reinforcement Learning in Embedding Space
摘要
密集检索模型通常采用对比目标进行训练,这些目标学习有效的表示,但不直接优化检索指标或下游任务性能。为了解决这个问题,我们引入了 RELER(REinforcement LEarning for Retrieval),这是一种强化学习框架,使现有的嵌入模型能够学习直接在嵌入空间中检索并与特定任务的奖励保持一致。我们通过从以标准化编码器输出为中心的 von Mises-Fisher (vMF) 分布中采样单位长度查询和文档嵌入动作来训练 RELER,对所得到的检索或下游结果进行评分作为奖励,并使用留一基线 (RLOO) 通过 REINFORCE 更新编码器。由于高维嵌入空间中的探索容易产生采样噪声,我们进一步提出了条件均值投影(CMP),它将每个采样嵌入投影到由其编码器输出和与之比较的候选嵌入所跨越的低维子空间上,减少了策略梯度 中的噪声,同时保留其期望。我们在 BRIGHT 上评估 RELER,BRIGHT 是一个具有推理密集型查询的基准,对于现有嵌入模型来说仍然具有挑战性。当 后训练 BGE-M3 和 Qwen3-Embedding 骨干模型 时,RELER 在平均 nDCG@10 方面始终优于 InfoNCE 和 LambdaLoss。我们通过检索增强生成(RAG)进一步评估下游效用,其中我们仅调整查询编码器,同时保持文档索引和生成器固定。在七个 QA 数据集中,联合优化检索和答案奖励可以提高 RAG 中的平均检索性能和答案质量。