论文

DRelay:用于前缀感知并行推测解码修复的全局草案上下文

DRelay: Global Draft Context for Prefix-Aware Parallel Speculative Decoding Repair

模型推理投机采样

摘要

并行起草减少了大语言模型 (LLM) 推测解码的起草开销,但其收益仍然受到可接受的前缀长度的限制。即使候选池中存在正确的标记,单个早期选择错误也会阻止后续预测的使用。我们提出了 DRelay,它使用整个草稿块的全局信息在目标模型验证之前对候选选择执行前缀感知选择性修复。 DRelay 的决策基于候选者的相关性和选定的路径:全局读取器为每个候选者跨位置提取预测信息。而因果选择器将全局读取提取的候选级信息与在先前位置选择的标记相结合,以确定当前位置的本地选择是否与全局证据和所选前缀一致。然后,它决定是否保留或替换词元,从而修复早期错误并扩展接受的前缀。我们进一步联合训练草案主干和选择器,将候选支持学习与修复目标相结合,同时根据每个块位置对连续接受前缀的潜在贡献来加权修复损失。在 H800 GPU 上的八个不同基准测试中,DRelay 持续改进了 DFlash、Domino 和 DSpark 的平均接受长度和端到端解码性能。在 SGLang 服务下,DRelay 比 DFlash、Domino 和 DSpark 平均端到端加速分别提高了 14.7%-16.8%、8.7%-9.3% 和 8.1%-9.3%。