论文

通过强化学习使用 LLM 反馈优化 RAG 重新排序器

Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning

模型训练强化学习

摘要

重新排序器在细化检索增强生成的检索结果方面发挥着关键作用。然而,当前的重新排名模型通常是在静态的人工注释相关性标签上单独优化的,与下游生成过程分离。这种隔离导致了根本性的错位:通过信息检索指标识别为主题相关的文档通常无法提供 LLM 生成精确答案所需的实际效用。为了弥补这一差距,我们引入了重新排名偏好优化(RRPO),这是一种强化学习框架,可以直接将重新排名与 LLM 的生成质量保持一致。通过将重新排名制定为顺序决策过程,RRPO 使用 LLM 反馈优化上下文效用,从而消除了对昂贵的人工注释的需要。为了确保训练稳定性,我们进一步引入了参考锚定的确定性基线。对知识密集型基准的大量实验表明,RRPO 显着优于强大的基准,包括强大的列表重排序器 RankZephyr。进一步的分析强调了我们框架的多功能性:它可以无缝地推广到不同的读者(例如 GPT-4o),与 Query2Doc 等查询扩展模块正交集成,并且即使在嘈杂的监督者的训练下也能保持稳健。