论文
被接受前缀不是全部:PEFT块扩散草稿的阴性结果
Accepted Prefixes Are Not All You Need: A Negative Result on PEFT-Based Block-Diffusion Drafting
摘要
投机解码以廉价草稿者提议多个未来token、由目标模型验证之,从而加速自回归语言模型推理。常见设计目标因此是在减少辅助参数与系统开销的同时改进草稿质量。我们通过PEFT-BD研究该方向的阴性结果:一种同底座投机解码方法——LoRA式适配器充当自回归验证器的块扩散草稿者。PEFT-BD的动机包括若干诱人属性:避免分词器错配、避免加载独立草稿模型、只添加少量可训练参数、并以BD3LM式去噪目标并行提议一块token。尽管有这些优势,PEFT-BD在我们的Qwen3-0.6B实验中未产生实用加速。虽然该方法获得可观的被接受前缀,性能剖析显示每个投机步需要一次启用适配器的全骨干草稿前向加一次禁用适配器的全骨干验证前向——草稿者参数高效但非计算高效。结果隔离出成功投机解码的一个简单而重要的条件:草稿者的执行成本必须显著低于验证者。仅更长的被接受前缀无法补偿草稿计算仍处验证器量级的情况。