论文
TSS:特定领域大型语言模型中推测解码的目标端稀疏化
TSS: Target-Side Sparsification for Speculative Decoding in Domain-Specific Large Language Models
摘要
推测性解码通过轻量级草稿模型和目标验证器之间的协作加速大型语言模型推理。现有方法主要改进拔模面,而目标模型通常保持密集且不变。我们表明,在特定领域的推理下,全深度目标验证并不总是最佳选择。与直觉相反,跳过选定的目标层可以降低验证成本,同时提高草稿接受度并保留甚至提高下游任务性能。基于这一观察,我们提出了 TSS,一种用于推测解码的目标端稀疏化框架。 TSS 采用接受和度量感知的广度搜索来探索多层跳过配置,而不在两个目标之间强加固定的优先级。选定的配置存储在域到配置的映射中,并由轻量级跳跃控制器应用,从而允许一个完整的目标模型支持多个稀疏验证路径,而无需重新训练或永久参数修剪。 Spec-Bench 跨多个领域、模型规模和推测解码方法的实验表明,草稿接受度和下游任务性能得到了持续改进。在翻译设置中,TSS 将平均接受长度从 2.70 增加到 4.53 (+67.8%),将 BLEU 从 0.131 提高到 0.237 (+80.9%),并将端到端吞吐量从 75.6 词元/秒提高到 127.3 个词元/秒,相当于 1.68 倍的加速。