论文

SumRank:对齐摘要模型以进行长文档列表重排序

SumRank: Aligning Summarization Models for Long-Document Listwise Reranking

模型训练偏好优化

摘要

大语言模型 (LLM) 在列表段落重排序任务中表现出了卓越的性能。然而,由于上下文长度大幅增加,直接应用它们对长格式文档进行排名会带来有效性和效率问题。为了应对这一挑战,我们提出了一种逐点摘要模型 SumRank,与下游列表重新排序相结合,在最终列表重新排序阶段之前将长格式文档压缩为简洁的排序对齐摘要。为了获得我们的摘要模型 SumRank,我们引入了一个三阶段训练管道,包括冷启动监督 微调 (SFT)、专门的 RL 数据构造和通过强化学习进行排名驱动的对齐。该范例将 SumRank 与下游排名目标保持一致,以保留相关性信号。我们对 TREC 深度学习轨道 (TREC DL 19-23) 的五个基准数据集进行了广泛的实验。结果表明,我们的轻量级 SumRank 模型实现了最先进的 (SOTA) 排名性能,同时通过减少汇总开销和重新排名复杂性来显着提高效率。