论文

BLD:在压缩块潜变量上去噪的扩散语言模型

Denoising Blocks, Not Tokens: Efficient Compressed Continuous Diffusion with Branching Token Realization

模型架构模型推理应用与实践混合架构推理加速通用理解与问答

摘要

扩散语言模型(DLM)通过迭代并行细化生成文本,可能获得高于自回归(AR)解码的吞吐。但多数DLM仍为每个Token保留一个生成状态,每次去噪都处理与输出同样长的状态序列,限制了并行生成收益。连续DLM带来额外自由度:一个连续状态可表示多个Token,让扩散在更短的潜序列上进行。我们提出分支潜空间扩散(BLD),把1024个Token压缩为64个块级潜变量,序列长度缩短16倍。BLD将潜变量压缩与分支Token实现结合:每个潜变量由一个局部AR分支解码,全部分支并行运行。强压缩使联合生成潜变量较困难,因此BLD分组生成,并以此前生成的潜变量作为条件。同一GPU上的端到端评测显示,相比规模相近的ELF-L基线,BLD将生成FLOPs降至不到其1/80,吞吐超过其6倍。相比AR基线,吞吐超过其6倍,延迟低于其1/4。尽管压缩较强,BLD仍具有有竞争力的局部流畅度和多样性,但长程连贯性仍是挑战。总体而言,将扩散从Token级状态转移到压缩潜序列,可显著提高长序列生成效率。