论文

视觉并非额外负担:通过单遍分块草拟实现视觉语言模型的无损推测解码

Vision Is Not Overhead: One-Pass Block Drafting for Lossless Speculative Decoding in Vision-Language Models

模型推理投机采样

摘要

推测性解码在不改变其输出的情况下加速了生成,但在视觉语言模型(VLM)上,它陷入了一个弄巧成拙的循环中。绘图器保持自回归,因此它必须保持较小。小绘图员无法承担每一步的图像,因此视觉被压缩、修剪或隐藏。与图像隔绝的绘图员在图像使文本可预测的地方最不可靠。我们推出了 GLANCE,这是第一个在未修改的 VLM 目标上无损的单通道块起草器,它打破了两端的循环。块扩散头读取目标已经融合的视觉语言状态,因此视觉不会花费绘图者任何成本,并且在一次前向传递中填充整个块,因此深度不花费连续步骤。在一次目标传递中验证了广泛的候选树,并且每个审核的提示都准确地再现了贪婪解码。扎根的工作负载对此给予了最大的回报,进入逐字复制制度,其长期运行花费了自回归起草者每一个token的通行证和区块起草者总共的通行证。在一个引擎和一轮预算下,GLANCE 的解码速度比自回归快 2.93 倍,从一次草案通过一轮开始,生产 EAGLE3-VL 头需要 8 个块,并且接受比在同一语料库上训练的 EAGLE-3 头长 2.7 倍的块。一项法律组织了这些结果。可接受的长度由目标的下一个令牌熵设定,并具有一个拟合斜率,该斜率随着所有五个任务的接地而变陡。该法律跨越目标和模式,并命名了自己的边界,因为自由运行的文本仍然有利于链条。我们的代码可在 https://github.com/js-lee-AI/GLANCE 获取。