论文
BV Loss:面向块扩散投机解码的块验证感知损失
BV Loss: Block Verification-Aware Loss for Block Diffusion Speculative Decoding
摘要
扩散起草者通过并行提出多个词元来加速推测解码。尽管最近通过序列级起草和验证在推测性解码方面取得了进展,但现有的训练目标仍然主要围绕词元级验证进行设计。为了解决这种不匹配问题,我们引入了块验证感知损失(BV损失),这是一个旨在最大化起草序列的预期接受长度的训练目标。 BV损失直接源自块验证接受规则,在序列级别的起草者训练目标和推理时间验证机制之间提供原则性连接。在数学、代码和聊天基准测试中,与使用 Qwen3-4B 和 Qwen3-8B 对 DFlash 和 DSpark 进行交叉熵损失训练相比,BV 损失在块验证下每次验证调用接受的平均词元数量增加了 13.0--21.0\%,而无需更改推理过程。 BV 损失还优于 TV 损失和 LK 损失等 tokenwise 接受目标,并且其收益扩展到 token 验证和贪婪解码。这些结果证明了以与序列级验证一致的目标来训练块扩散起草者的好处,而不是单独优化每个词元。