论文

RL-Index:检索索引推理的强化学习

RL-Index: Reinforcement Learning for Retrieval Index Reasoning

上下文与知识检索增强

摘要

检索外部知识对于现实世界的任务至关重要,但当查询和相关知识通过隐式推理(例如共享定理或编码逻辑)链接时仍然很困难。现有方法主要依赖于查询端推理,导致在线延迟较高且未充分利用知识语料库中的推理语义。在本文中,我们提出了$\textbf{RL-Index}$,一个将检索索引推理制定为强化学习问题的索引框架。 RL-Index 不是在查询时执行推理,而是通过使用 LLM 生成的显式编码潜在查询知识关系的基本原理来扩充文档,从而将推理转移到索引阶段。为了优化这些基本原理的质量,我们采用组相对策略优化(GRPO)并使用检索相似性作为代理奖励信号,从而能够直接优化索引决策以提高检索效率。 BRIGHT 基准测试的大量实验表明,RL-Index 持续提高检索和下游问答性能,同时显着减少在线推理延迟。此外,学习到的基本原理增强可推广到不同的 检索器 和生成器,突出了其作为跨不同检索系统的即插即用索引策略的鲁棒性。