论文
LaneRoPE:面向协作式并行推理与生成的位置编码
LaneRoPE: Positional Encoding for Collaborative Parallel Reasoning and Generation
摘要
并行LLM测试时扩展技术(如best-of-$N$)需要以同一输入提示词为条件抽取$N>1$条序列。这些方法在利用$N$路生成批处理的计算效率的同时提升准确率。然而,批中的每条序列传统上独立生成,因此不会复用来自其他序列的中间生成结果、计算或观测。本文提出LaneRoPE,使$N>1$条序列在生成时能够进行协调与协作。LaneRoPE包含两个关键思想:(a)一种序列间注意力掩码,使各序列的采样相互依赖;(b)一种RoPE扩展,注入能够刻画token相对位置的位置信息,既包括特定序列内部,也包括序列之间。我们在数学推理任务上评估该方法并得到有前景的结果:LaneRoPE实现了序列间的协作,在受限的生成长度下带来额外的准确率提升。重要的是,由于LaneRoPE以对底层LLM架构的最小改动实现协调,且在推理时引入的开销可忽略不计,因此非常适合快速将并行推理融入现有的LLM推理管线。
