论文

OptiSet:面向检索增强生成的集合选择与排序统一优化

OptiSet: Unified Optimizing Set Selection and Ranking for Retrieval-Augmented Generation

上下文与知识检索增强

摘要

检索增强生成(RAG)通过纳入从大型外部语料库检索到的证据来提升生成质量。然而,大多数现有方法依赖基于单条相关性静态选取top-k段落,未能利用段落之间的组合增益,且常常引入大量冗余。为解决这一局限,我们提出OptiSet,一个为RAG统一集合选择与集合级排序的以集合为中心的框架。OptiSet采用“先扩展后精炼”的范式:先将查询扩展为多个视角以形成多样化的候选池,再通过重选对候选池进行精炼,构成一个紧凑的证据集。随后,我们设计了一种无需强LLM监督的自合成策略,从生成器的集合条件效用变化中导出偏好标签,从而识别互补与冗余证据。最后,我们引入一种集合-列表级训练策略,联合优化集合选择与集合级排序,使模型偏向紧凑、高增益的证据集。大量实验表明,OptiSet在复杂组合问题上提升了性能,并使生成更高效。源代码已公开。

OptiSet:面向检索增强生成的集合选择与排序统一优化 配图
图 2:OptiSet 框架图。上半部分表示“先扩展再精炼”(Expand-then-Refine)范式,它既可作为免训练框架,也可作为训练数据合成流水线。下半部分表示集合-列表级(set-list wise)训练。它利用框架生成的多个集合,执行偏序排序与信号标注,并训练选择器。