论文

先预测后扩散:扩散中计算预算推理的自适应响应长度 LLM

Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs

模型推理测试时计算扩展

摘要

基于扩散的 大语言模型 (D-LLM) 代表了生成 AI 领域的一个有前途的前沿,它提供完全并行的词元生成,与传统的自回归范例相比,可以带来显着的吞吐量优势和卓越的 GPU 利用率。然而,这种并行性受到生成之前固定大小响应长度的要求的限制。这种架构限制带来了严重的权衡:过大的响应长度会导致语义上无意义的填充词元上的计算浪费,而过小的响应长度会导致输出截断,需要昂贵的重新计算,从而引入不可预测的延迟峰值。为了解决这个问题,我们提出了 Predict-then-Diffuse,这是一个简单且与模型无关的框架,它通过首先估计响应长度,然后使用它通过 D-LLM 运行推理来实现每个输入查询的计算预算推理。其核心是自适应响应长度预测器 (AdaRLP),它可以估计给定输入查询的最佳响应长度。作为防止低估响应长度和以更高值重新运行推理的措施,我们引入了一种基于预测长度小幅增加的数据驱动安全机制。总的来说,我们的框架避免了在填充标记上浪费计算,同时保持输出质量。对多个数据集的实验验证表明,与默认的 D-LLM 推理机制相比,Predict-then-Diffuse 显着降低了计算成本 (FLOP),同时对倾斜的数据分布具有鲁棒性。