论文
通过强化学习进行黑盒检索的文档优化
Document Optimization for Black-Box Retrieval via Reinforcement Learning
摘要
文档扩展是一种提高检索质量的经典技术,并且很有吸引力,因为它将计算转移到离线状态,避免了额外的查询时处理。然而,当应用于现代 检索器 时,它已被证明会降低性能,通常会引入混淆判别信号的噪声。我们将文档扩展重新定义为文档优化问题:使用 GRPO 和 检索器 的排名改进作为奖励,对语言模型或视觉语言模型进行微调,将文档转换为与目标 检索器 下的预期查询分布更好地一致的表示。该方法仅需要对检索排名进行黑盒访问,并且适用于单向量、多向量和词汇 检索器。我们评估我们在代码检索和视觉文档检索(VDR)任务方面的方法。我们发现学习的文档转换会产生检索增益,并且在许多设置中使更小、更高效的 检索器 能够胜过较大的文档。例如,将文档优化应用于 OpenAI text-embedding-3-small 模型可提高代码上的 nDCG5(58.7 至 66.8)和 VDR(53.3 至 57.6),甚至略高于昂贵的 6.5 倍的 OpenAI text-embedding-3-large 模型(代码为 66.3;VDR 为 57.0)。当 检索器 权重可访问时,文档优化通常与 微调 具有竞争力,并且在某些设置中,它们的组合表现最佳,将 Jina-ColBERT-V2 在 VDR 上从 55.8 提高到 63.3,在代码检索上从 48.6 提高到 61.8。