论文

AdaTutoRank:用自适应指导训练RAG证据集合重排

AdaTutoRank: Learning to Rerank Document Sets via Adaptive Tutoring Optimization for RAG and Deep Research

上下文与知识模型训练模型优化强化学习检索增强蒸馏

摘要

文档重排序器决定哪些证据到达RAG和深度研究中的下游模型,而主流重排序器通过相关性匹配来选择,并且单独的相关文档很少构成复杂信息需求的完整、互补、非冗余集合。之前的工作根据集合的总评分来奖励集合,将目标从对文档进行排序转变为组合集合。然而,该分数是集合中每个文档共享的一个标量,因此监督是稀疏的:每当集合得分良好时,冗余文档就会与其余文档一起得到奖励,而当集合得分不好时,决定性文档就会与其余文档一起受到惩罚;信用分配使贡献者与搭便车者没有区别。策略蒸馏可以强化这种监督,但现有的方法为每次rollout提供相同的固定指导,对于强rollout来说过于规范,而对于弱rollout来说则过于抽象。因此,我们提出了 AdaTutoRank,这是一种在九个评分规则维度的三级层次结构下使用自适应辅导优化(ATO)进行训练的集合重排序器,它为冷启动提供银标签,为强化学习提供奖励,并为蒸馏提供提示。 ATO 从策略本身的冻结快照中提取了三种日益明确的提示形式:单独的评分规则、在评分规则下选择的自我选择者的兄弟集以及自我反思者将rollout与该兄弟集进行对比的反思;每次rollout都会收到与其质量相匹配的形式。在提示条件冻结教师和无提示快照下重新评分,将提示的效果提炼为词元级别的优势,补充了相对于组的结果优势。在涵盖 RAG、深度研究和集合评估的 10 个基准测试中,AdaTutoRank 获得了最佳的整体性能,同时发出的检索调用更少。