论文

多模态投机解码已为基于扩散的并行起草做好准备了吗?一项综述与实证诊断

Is Multimodal Speculative Decoding Ready for Diffusion-Based Parallel Drafting? A Survey and Empirical Diagnosis

模型评测模型能力评测

摘要

投机解码通过让轻量起草模型提出未来令牌、同时由目标模型并行验证来加速自回归生成。其无损保证催生了一系列推动起草模型自身走向并行生成的工作。最新的范式是块并行生成式起草,包括DFlash、DSpark等基于扩散的方法,在常见日常对话任务上取得最高3.6倍的加速。虽然这一转变在纯文本LLM中已被充分研究,但其在多模态模型上的适用性仍是开放问题。现有多模态投机解码工作集中于输入压缩、适配器对齐、候选覆盖或模态特定验证;然而块并行生成式起草在很大程度上尚未被探索。为弥合这一空白,本文将面向模态的综述与跨架构实证研究结合起来,发问:多模态投机解码已为基于扩散的并行起草做好准备了吗?在这项综述中,我们从起草并行度与跨模态信息交互两个视角,系统分析了广泛的多模态模型,涵盖视觉-语言、视频-语言、音频以及视觉-语言-动作(VLA)架构。我们引入统一分类法,将起草端并行度与树构建、验证策略等正交设计选择分离。此外,我们在OCR、VQA、视觉推理与图像描述等标准化多模态基准上,对现有方法在不同并行度下进行了全面的实证比较。最后,我们总结现有方法的局限,讨论开放挑战,并勾勒这一快速发展领域的未来方向。

多模态投机解码已为基于扩散的并行起草做好准备了吗?一项综述与实证诊断:论文配图
图 1:代表性多模态推测解码方法的分类和演变。