论文

Oilbird:利用验证器已有索引键的免训练推测解码

Oilbird: Training-Free Speculative Decoding with Keys the Verifier Already Computes

模型推理投机采样

摘要

免训练的推测解码通过将当前上下文的精确后缀与先前上下文池匹配来生成草稿。但这种查找会遗漏池中已有的正确草稿,工具调用流量中尤其明显:请求几乎全部重复,只改变少数本次生成的值;一旦一个词元被拒绝,其后本来正确的续写也会被丢弃。作者在十个基准上逐位置诊断失效,发现问题主要在寻址而非覆盖率。在工具调用最密集的基准上,最强精确匹配草稿器漏掉的内容约有一半实际已在池中,却无法通过精确匹配取出。因此提出第二种语义草稿来源:仍使用同一池,但以验证器在每个已接受词元上算出的隐藏状态重新建立索引,并通过合并机制嵌入现有词法草稿器的树中。在三种已发表草稿器中,控制相同池与预算后,接受长度提升24%—29%。Oilbird在API-Bank上达到自回归解码速度的4.4倍;同一Harness内最强免训练基线为3.9倍,EAGLE-3为2.0倍。

Oilbird:利用验证器已有索引键的免训练推测解码:论文配图
图1:答案就在对话中,精确匹配仍然无法到达。一个真实的 API-Bank 请求,已在第 3 节中完成;整个提示和输出如图 6 所示。蓝色标记模型即将生成的值,该值已存在于对话中;红色标记复制返回的内容;虚线框是词汇键匹配并向前复制的范围。