论文

更快的块扩散服务与无分布假设的风险保证

Faster Block-Diffusion Serving with Distribution-Free Risk Guarantees

模型推理推理加速

摘要

块扩散语言模型在精心挑选的操作点上提供服务,例如接受阈值、缓冲区深度、调度、检查点和精度,每个点都是根据其平均基准精度来选择的。然而,均值并不能告诉操作员更快的配置在提示较慢的配置正确回答时失败的频率。在服务引擎及其解码跟踪上,默认提交规则已经提交了每个完全解析的块,静态跳过规则捕获了分配可以节省的几乎所有计算,并且引擎解码目标上的自蒸馏在保持精度不变的情况下提高了速度。更大的加速来自较低的阈值,这会提交仍然不确定的词元。因此,我们提出了 Redline,这是一种有限样本程序,可以根据校准提示的答案的正确性来选择手工挑选或学习的操作点。 Redline 将参考相对风险(参考答案正确而候选配置未正确答案的联合概率)保持在用户选择的预算内,并以高概率部署最快通过的配置。与两个模型系列中的代码相比,它以更小的风险预算加速了数学计算,并且以百分之十的预算部署了 LLaDA2 数学配置,该配置在每个转发中多提交了三分之一以上的词元。它也无需修改地适用于推测解码的接受规则和权重量化。在相同的校准数据上,Redline 保持在其规定的故障概率范围内,而平均精度规则的每个容差对于某些模型和任务来说要么获得较低的速度,要么对于另一个模型和任务更频繁地超出风险预算。代码可在 https://github.com/js-lee-AI/Redline. 获取