论文
HAWK:重新思考推测解码的多模态起草
HAWK: Rethinking Multimodal Drafting for Speculative Decoding
摘要
推测性解码已经为 LLM 实现了大幅无损加速,但对于大型视觉语言模型 (LVLM) 仍然不太有效,因为轻量级绘图人员很难使用丰富的多模态信息。第二个限制是标准蒸馏仅沿着原始训练轨迹监督起草者,而没有对目标预测在起草者自己的建议之后如何变化进行建模。随着起草过程偏离这一轨迹,起草者可能会越来越不同意目标,从而降低后续步骤的接受度。我们建议 HAWK 来解决这两个限制。 HAWK 使用表示相似性来选择信息丰富的目标层并学习如何组合它们的隐藏状态。对于视觉信息,它直接为绘图者提供来自目标模型的压缩视觉隐藏状态,而不是原始视觉词元,使视觉信息更容易为浅绘图者使用。 HAWK 还训练起草者捕获目标预测在其自己的提案之后如何变化,从而在多步骤起草过程中提高其与目标的一致性。在 SmolVLM-256M 的十个多模态基准测试中,HAWK 在贪婪解码下将平均接受长度从 3.32 提高到 4.08,比 EAGLE-3 加速从 2.19 倍提高到 2.60 倍,在采样下从 2.89 提高到 3.41,从 1.92 倍提高到 2.19 倍。