论文

停止过度思考:用最少的推理解锁有效的列表重排

Stop Overthinking: Unlocking Efficient Listwise Reranking with Minimal Reasoning

摘要

利用 大语言模型 (LLM) 的列表重排序已经实现了最先进的检索效率。最近,推理增强模型通过采用思想链(CoT)对候选文档进行深度比较分析,进一步突破了这些界限。然而,这种性能提升的代价是高昂的计算成本,因为模型在产生最终排名之前通常会生成数千个推理标记。在这项工作中,我们研究了推理长度和排名质量之间的关系,揭示了一种过度思考的现象,即扩展推理会产生收益递减。为了解决这个问题,我们提出了一个长度规整的自 蒸馏 框架。我们通过从教师模型(Rank-K)中采样不同的推理轨迹来合成数据集,并应用帕累托启发的过滤器来选择以最少的词元使用实现高排名性能的轨迹。通过 微调 这些简洁、高质量的基本原理,学生模型学会内化高效的推理模式,有效地修剪多余的思考。 TREC 深度学习和 NeuCLIR 基准测试表明,我们的方法保持了教师的有效性,同时在不同的检索设置中减少了 34%-37% 的推理词元消耗,为在延迟敏感的应用程序中部署推理增强型重排序器提供了实用的解决方案。