论文
Diffusion-GR2:扩散生成推理重排序器
Diffusion-GR2: Diffusion Generative Reasoning Re-ranker
摘要
生成推理重排序器通过在重新排序候选列表之前发出一条思想链来实现很强的推荐准确性,但它们的推理速度很慢:自回归 (AR) 解码器为每个推理标记花费一次顺序前向传递,并且推理轨迹远远超过其产生的排名。为了降低这一成本,块扩散语言模型通过几个去噪步骤并行解码许多位置,并且速度要快得多,但天真地将 AR 重排序器转换为一个重排序器会带来两个精度差距:(1)结构性差距:答案位置并行去噪并独立评分,因此解码器会发出无效的排名(重复、丢弃或超出设置的标识符),而 AR 通过从左到右的屏蔽来避免这些排名; (2) 分布差距:微调 固定教师轨迹上的转换模型相对于其自身的推理解码为 离策略,留下残余精度差距。为了在保持加速的同时缩小这两个差距,我们提出了 \textbf{Diffusion-GR2},这是一种将我们的 AR 推理重排序器 (GR2) 转换为块扩散重排序器的方法。首先,转换 微调 (CFT) 采用 AR 初始化的扩散模型,将答案去噪为自身有效的排列,无需外部约束解码器。接下来,同策略 蒸馏 (OPD) 使用 AR 教师提供的密集的每个词元目标,在其自己的解码轨迹上监督模型。最后,我们在 OPD 的 同策略 政策之上应用强化学习 (RL) 阶段来对抗重新排名奖励。 Amazon Beauty 上的实验表明,Diffusion-GR2 恢复到与 AR 重新排序器接近的水平,而块并行解码在模型的推理输出长度上将解码吞吐量提高了 $2.4$--$3.5\times$。消融显示 CFT 恢复了大部分转换差距,并且 同策略 蒸馏 进一步使其接近 AR 参考。