论文
BitNest:位嵌套推测解码
BitNest: Bit-Nested Speculative Decoding for Memory-Efficient LLM Inference Acceleration
摘要
推测解码用轻量草稿提议多个token并行验证以加速自回归生成。但现有方法常需额外草稿模型或权重表示,给资源受限设备带来不可忽视的内存开销;自投机方法降低该开销,却仍面临草稿质量、目标质量与存储效率的权衡。我们提出位嵌套推测解码框架BitNest:把低精度草稿直接嵌入更高精度的目标表示——不是从预定义目标导出草稿,而是先构造强低精度基座、再经残差细化恢复更高精度目标,使两模型共享单一物理权重表示。BitNest进一步把这种渐进精度设计扩展到长上下文推理的KV缓存。跨多个7B-8B边缘友好LLM与多样工作负载,BitNest取得平均95.2%的推测接受率并紧密保持高精度模型质量,端到端较FP16自回归解码加速1.48-1.61倍;在所有代表性自投机基线支持的LLaMA模型上也取得持续相当或更高的解码加速。