论文

Spec-AUF:掩码块扩散模型的训练-推理失配下的接受直到失败训练

Spec-AUF: Accept-Until-Fail Training under Train-Inference Misalignment for Masked Block Drafters

模型训练监督微调与指令调优

摘要

投机解码通过起草一个由目标模型从左到右验证的token块来加速自回归生成——仅提交被接受的最长前缀。块式(DLM风格)起草器并行预测整块——速度快——但以全块交叉熵训练——对每个位置按黄金续写监督——尽管推理在首次拒绝后丢弃后续所有token。近期接受感知的目标经重加权全块损失修补此问题;我们转而以教师强制学习为动机——主张监督应集中在被接受前缀上。仅掩码的块起草器没有输入侧的黄金前缀条件化通道——因此AUF在损失侧近似该前缀敏感监督——将交叉熵支撑仅保留到起草器的首个预测失败处。AUF是对CE支撑的单一、分离的改动——无辅助目标、无验证器rollout、不改变推理管线或精确性契约。在Qwen3-8B上的固定起草器骨干与服务设定内——AUF将DFlash起草器在六个基准上的平均发射长度τ从2.40提升至2.61——每个基准都有增益——并迁移到Domino的双分支头(2.56至2.68)。两个发现进一步锐化图景:仅衰减基线在共享块掩码上达到更高token准确率却解码更差;且在DFlash上——一旦AUF截断支撑——标准的指数位置衰减加权在经验上变得失效。

Spec-AUF:掩码块扩散模型的训练-推理失配下的接受直到失败训练:论文配图
图 1:教师强制训练自回归草稿模型。该模型接收黄金前缀作为输入并预测移动的目标标记,因此每个 CE 术语都在前缀正确的条件下进行训练。