LiLiCorr:推测解码 并行草稿的轻量级似然相关
LiLiCorr: Lightweight Likelihood Correlation of Parallel Drafts for Speculative Decoding
摘要
推测解码 通过起草目标模型并行验证的未来标记来加速语言模型推理。诸如 DFlash 之类的扩散式起草器会在一次前向传递中起草整个块。它是在每个位置的边缘上进行训练的,而不是在块上的联合分布上进行训练的,因此它发出的词元单独合理但联合起来不连贯。我们引入了 LiLiCorr,一种基于轻量似然的模型,它与绘图员产生的每个位置的边际相关联。它将前 K 个标记保留在每个位置并联合处理它们,为每个标记发出一个输入和一个输出向量。当较早出的向量以余弦相似性与较晚的向量对齐时,连续位置上的两个候选者匹配。训练对正确配对的得分最高,而对竞争配对的得分则较低,因此连贯的块比不连贯的块得分更高。块上的联合分布(其长度呈指数级)永远不会实现。一次轻量级网络传递生成所有向量,成对分数遵循批量矩阵运算,仅留下廉价的贪婪游走顺序。我们与 LiLiCorr 共同训练 DFlash 绘图员,因此它会提出与更长的可接受序列相关的候选序列。在我们所测试的所有 72 种设置中,LiLiCorr 在其构建的普通 DFlash 起草器上接受更多,服务速度更快:贪婪和温度一解码下两种目标大小的 9 个基准,加上对 6 个并发、两个输入长度和三个输出熵层的吞吐量扫描。它将接受长度提高了 7% 到 19%,而其单遍评分头的成本仅为每块延迟的 3% 左右。与同时开发的三种同时在草稿时恢复一致性的方法(所有方法均在同一堆栈上进行了同等优化)相比,LiLiCorr 在其中 63 种设置中保持最高吞吐量,在 6 种设置中保持在测量本底噪声内,仅在 3 种设置中落后。