论文
VIA-SD:通过 推测解码 的模型内路由进行验证
VIA-SD: Verification via Intra-Model Routing for Speculative Decoding
摘要
推测解码 (SD) 通过让轻量级起草者生成候选者以供大型验证者并行验证,解决了 LLM 的高推理成本问题。现有的草稿验证方法使用二元决策:接受或完全重新计算。然而我们发现,许多被拒绝的词元可以通过通过模型内路由从完整验证器派生的细长子模型(而不是完整验证器)来正确验证。这促使我们的 slim-verifier 处理需要适度验证资源的词元,从而减少昂贵的大型模型调用。我们建议通过 推测解码 (VIA-SD) 的模型内路由进行验证,这是一个使用路由 slim 验证器的多层框架。草稿词元是分层处理的:高置信度情况下直接接受,中等置信度情况下进行轻量验证器再生,不确定情况下进行全模型验证。在四个代表性任务和多个模型系列中,VIA-SD 将拒绝率降低了 0.10-0.22,并在强大的 SD 基线上提供了 10-20% 的加速,同时实现了比非草稿解码 2.5-3 倍的加速。此外,VIA-SD与现有的SD框架兼容,无需修改其训练程序。我们的结果表明多层 SD 作为可扩展且高效的 LLM 推理的通用范例。项目页面:https://zju-xyc.github.io/VIA-SD-Project-Page/