论文

FOVEA:针对缓存友好的多模式的集中按需视觉证据适应 推测解码

FOVEA: Focused On-Demand Visual Evidence Adaptation for Cache-Friendly Multimodal Speculative Decoding

模型推理投机采样

摘要

多模态 推测解码 通过允许轻量级草稿模型提出候选标记以供更大的目标模型进行并行验证来加速视觉语言模型。现有方法通常将绘图者限制在固定的视觉界面上,例如预定义的视觉 词元预算 或静态压缩表示。然而,我们的受控视觉预算分析表明,不同任务和解码阶段的视觉需求差异很大,这意味着更多的视觉输入并不总是有益的。事实上,证据不足可能会削弱视觉基础,而过多的上下文会增加开销并可能扰乱起草。我们提出了 FOVEA(集中按需视觉证据适应),这是一种缓存友好的方法,可构建可重用的视觉内存并动态检索草稿状态的有界子集。累积质量规则决定了选择的条目数量和条目。选定的条目被聚合成视觉读数,并通过轻量级门控残差校正与当前草稿隐藏状态融合。校正仅修改传递到语言模型头部的表示,而不是将视觉标记插入到自回归上下文中。跨多个视觉语言主干和多模态基准的实验表明,FOVEA 提高了草稿接受度和端到端解码速度,比自回归解码实现高达 2.13 美元\倍的加速。这些结果表明,状态条件证据检索是在整个多模式生成过程中重用固定视觉表示的有效替代方案。