论文

推测解码 验证感知训练

Verification-Aware Training for Speculative Decoding

模型训练奖励建模与过程监督

摘要

推测解码 通过使用草稿模型生成候选词元来加速 大语言模型 推理,这些候选词元由目标模型在单次前向传递中进行验证。验证按顺序进行,并丢弃从第一次拒绝开始的每个位置,但现有的选秀训练依赖于 词元级 对目标的模仿,每个位置的固定权重反映了这两种属性。我们引入了验证感知训练(VAT),这是一个插件框架,可以模拟每个训练步骤的验证,并将生成的接受和拒绝模式转化为监督。 VAT 由两个部分组成:(i) 验证头,一个轻量级联合训练的二元分类器,用于监督草稿模型的每个位置是否能够通过顺序验证; (ii) 验证自适应加权,它通过将全部权重保持在每个样本的第一个拒绝点并重新锚定衰减从该点开始来取代固定加权方案。 VAT 仅修改训练目标,因此它可以分层在现有方法之上,而无需更改草案架构、目标模型或推理过程。应用于 Qwen3-4B、Qwen3-8B 和 LLaMA-3.1-8B 上的 EAGLE-3 和 DFlash 时,VAT 将平均接受长度提高了 11.4%,挂钟速度提高了 8.7%,在数学、代码和聊天基准测试中获得了一致的收益。代码将在 https://github.com/naver-ai/vat 提供