论文
混合语言模型中的组件感知自 推测解码
Component-Aware Self-Speculative Decoding in Hybrid Language Models
摘要
推测解码 通过使用快速模型起草候选标记并与目标并行验证它们来加速自回归推理。自推测方法避免了对外部起草者的需要,但仅在同质 Transformer 架构中进行了研究。我们引入了组件感知的 self-推测解码,这是第一个利用混合语言模型的内部架构异构性的方法,将 SSM/线性注意力子图隔离为零成本的内部草案。我们在两个架构上不同的混合系列上进行评估:Falcon-H1(并行:Mamba-2 + 每层注意力)和 Qwen3.5(顺序:交错的线性和注意力层),以及纯 Transformer 控制(Qwen2.5)。在贪婪解码下,并行混合在草稿长度 k=2 时实现了 alpha = 0.68 的接受率,而顺序混合仅产生 alpha = 0.038——由于每个架构如何集成其组件,存在 18 倍的差距。该属性是尺度不变的:Falcon-H1 在 3B 处再现了在 0.5B 处观察到的速率。我们进一步表明,在不运行 推测解码 的情况下,伴随消融研究的困惑度退化可以预测推测的可行性:3.15x 比率 (Falcon) 在 k=4 时映射到 alpha = 0.37,而 81.96x (Qwen) 映射到 alpha = 0.019。对于顺序混合,通用 LayerSkip 的接受率比组件感知策略高 12 倍。混合模型的组成模式(不仅仅是替代组件的存在)决定了组件级自我推测是否可行。