论文

D-PACE:用于并行推测绘图的动态位置感知交叉熵

D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting

模型推理投机采样

摘要

推测解码 通过让小型起草者提出由较大目标模型并行验证的标记来加速 LLM 推理。最近基于扩散的并行起草器(例如 DFlash)可以在一次前向传递中预测完整的 B 词元块,从而实现更深的起草器和更长的接受块。然而,现有的多词元起草器目标通常使用固定的位置相关加权方案,例如头部相关权重或块位置衰减,这些方案不会随着训练期间限制接受的位置变化而适应。为了解决这个问题,我们从预期可接受草稿长度的可微替代项中得出每个位置的训练权重,将每个位置的权重与其对数概率梯度贡献相匹配。由此产生的损失 D-PACE(动态位置感知交叉熵)将训练信号转移到当前限制接受度的位置(随着制图员的改进)。在六个基准测试、两个 Qwen3-4B 拔模深度、两个解码温度和两个附加目标模型中,D-PACE 持续改进了挂钟加速和平均发射长度,测得的训练时间开销为 2.3%,并且未对拔模器架构或推理过程进行任何更改。