论文

LaneRoPE:面向协作式并行推理与生成的位置编码

LaneRoPE: Positional Encoding for Collaborative Parallel Reasoning and Generation

模型架构Transformer

摘要

并行LLM测试时扩展技术(如best-of-$N$)需要以同一输入提示词为条件抽取$N>1$条序列。这些方法在利用$N$路生成批处理的计算效率的同时提升准确率。然而,批中的每条序列传统上独立生成,因此不会复用来自其他序列的中间生成结果、计算或观测。本文提出LaneRoPE,使$N>1$条序列在生成时能够进行协调与协作。LaneRoPE包含两个关键思想:(a)一种序列间注意力掩码,使各序列的采样相互依赖;(b)一种RoPE扩展,注入能够刻画token相对位置的位置信息,既包括特定序列内部,也包括序列之间。我们在数学推理任务上评估该方法并得到有前景的结果:LaneRoPE实现了序列间的协作,在受限的生成长度下带来额外的准确率提升。重要的是,由于LaneRoPE以对底层LLM架构的最小改动实现协调,且在推理时引入的开销可忽略不计,因此非常适合快速将并行推理融入现有的LLM推理管线。

LaneRoPE:面向协作式并行推理与生成的位置编码:论文配图
图 2:RoPE [30] 和 LaneRoPE 并行推理的比较。 (a) 并行推理(例如,N 中最佳)依赖于独立生成序列。因此,位置编码和注意力分数仅针对每个序列进行定义。 (b) 使用 LaneRoPE,通过因果性地关注所有序列中的标记来生成标记。我们通过引入跨序列注意力分数和新颖的位置编码方案来考虑序列间相对距离来实现这一目标。