论文

TIGER:用文本条件视觉门控和接受率对齐加速多模态推测解码

TIGER: Text-Conditioned Visual Gated Routing with Acceptance Alignment for Multimodal Speculative Decoding

模型推理投机采样

摘要

推测解码由轻量草稿模型提出多个词元,再由较大目标模型验证,能加速自回归生成。但视觉语言模型的关键视觉内容容易使草稿偏离目标,现有加速方法也未直接处理无关视觉证据或优化决定速度的验证接受前缀长度。TIGER采用文本条件视觉门控路由,按草稿模型当前文本状态动态选择少量相关视觉词元,而非提供全部词元或固定压缩接口。 作者先用蒸馏预热并保留KL锚定,再以验证器提供的接受前缀长度奖励进行分组策略训练,使草稿模型不仅模仿目标,还生成能通过更长前缀验证的续写。严格验证器侧推测解码实验显示,接受前缀长度和加速效果稳定改善;视觉路由分析中,在下游准确率相近的情况下取得有利的质量—延迟权衡。