论文

SPD:用于生成重排序的单通道解码

SPD: Single Pass Decoding for Generative Reranking

模型推理推理加速

摘要

大语言模型 (LLM) 实现了最先进的生成排名质量,但它们产生的排名必须进行解码,并且自回归解码对每个发出的词元花费一次顺序前向传递。我们观察到,排名器必须发出的唯一标记是按排名顺序命名项目的 $N$ 序数值,并且这种狭窄的排列结构输出格式允许比从左到右生成更有效的解码策略。我们引入 SPD(单前向传递),这是一种格式专用的解码策略,可以解码 $O(1)$ 前向传递中的所有 $N$ 序数。 SPD 使用轻量级自注意力头从 LLM 的预填充隐藏状态中读取 $N \times K$ 项目位置得分矩阵,然后通过匈牙利算法将序数解码为该矩阵的最佳二分分配,通过构造而不是通过修复产生有效的排列。通过对训练信号和骨干适应的系统研究,我们表明基于 LoRA 的 微调 与自回归 LLM 排名相结合,蒸馏 达到了 28 毫秒的端到端推理,加速了 64 倍,同时保持了与教师相同的排名质量。我们提供完整的消融,分解架构、训练信号和骨干适应的贡献。我们的框架将生成排名与组合优化联系起来,为实时排名的其他 $O(1)$ 解码机制开辟了道路。