论文

Fast-dVLM:通过自回归 VLM 直接转换的高效块扩散 VLM

Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM

模型推理推理加速

摘要

视觉语言模型 (VLM) 主要依赖于自回归解码,它一次生成一个词元,从根本上限制了推理吞吐量。这种限制在机器人和自动驾驶等物理人工智能场景中尤其严重,其中 VLM 以批量大小部署在边缘设备上,导致 AR 解码内存带宽受限,并使硬件并行性未得到充分利用。虽然分块离散扩散已显示出并行文本生成的前景,但将其扩展到 VLM 仍然具有挑战性,因为需要联合处理连续视觉表示和离散文本标记,同时保留预训练的多模态功能。我们提出了 Fast-dVLM,这是一种基于块扩散的 VLM,它支持 KV 缓存兼容的并行解码和推测块解码,以实现推理加速。我们系统地比较了两种 AR 到扩散的转换策略:一种两阶段方法,在多模态训练之前首先将 LLM 主干与纯文本扩散 微调 相适应,以及一种直接方法,在一个阶段中转换完整的 AR VLM。在可比较的训练预算下,通过利用已经多模式对齐的 VLM,直接转换的效率大大提高;因此,我们采用它作为我们的推荐食谱。我们引入了一套多模态扩散适应、块大小退火、因果上下文注意、自动截断掩蔽和视觉高效连接,这些共同在 VLM 设置中实现有效的块扩散。跨 11 个多模式基准的广泛实验表明,Fast-dVLM 在生成质量方面与其自回归对应物相匹配。通过 SGLang 集成和 FP8 量化,Fast-dVLM 的端到端推理速度比 AR 基线提高了 6 倍以上。