论文
BARD:通过高效的渐进块合并和阶段式 蒸馏 连接自回归和扩散视觉语言模型
BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation
摘要
自回归视觉语言模型 (VLM) 提供强大的多模态功能,但它们的逐个词元解码造成了基本的推理瓶颈。扩散 VLM 提供了更加并行的解码范例,但直接将预训练的自回归 VLM 转换为大块扩散 VLM (dVLM) 通常会导致质量大幅下降。在这项工作中,我们提出了 BARD,这是一种简单而有效的桥接框架,可将预训练的自回归 VLM 转换为相同架构、解码高效的 dVLM。我们的方法将渐进式监督块合并(逐渐扩大解码块大小)与来自固定小块扩散锚的阶段式内 dVLM 蒸馏 相结合,以恢复较大块时损失的性能。我们进一步结合了混合噪声调度程序,以提高去噪期间的鲁棒性和标记修正,以及内存友好的训练,以实现对长多模态序列的有效训练。一个关键的实证发现是,直接自回归到扩散 蒸馏 的一致性较差,甚至会损害性能,而扩散机制内的 蒸馏 始终有效。实验结果表明,利用 $\leq$ 4.4M 数据,BARD-VL 将强大的多模态能力从 Qwen3-VL 转移到大块 dVLM。值得注意的是,BARD-VL 在我们的评估套件上的 4B 和 8B 规模的可比规模开放 dVLM 中建立了新的 SOTA。同时,与源模型相比,BARD-VL 实现了高达 3$\times$ 的解码吞吐量加速。代码可在 https://github.com/fudan-generative-vision/Bard-VL 获取。