论文

SDFP:基于FIT剪枝模型的免训练即插即用LLM加速推测解码

SDFP: Speculative Decoding with FIT-Pruned Models for Training-Free and Plug-and-Play LLM Acceleration

模型推理投机采样

摘要

大语言模型(LLM)支撑着字幕生成、检索、推荐和创意内容生成等交互式多媒体应用,但其自回归解码带来显著延迟。推测解码利用轻量草稿模型降低延迟,但部署常受限于获取、调优和维护有效草稿模型的成本与复杂性。近期方法通常需要辅助训练或专门化,即使是免训练方法也需要代价高昂的搜索或优化。我们提出SDFP,一个完全免训练、即插即用的框架,通过对给定LLM进行基于Fisher信息迹(FIT)的层剪枝来构建草稿模型。SDFP以层敏感度作为输出扰动的代理,移除低影响层以获得紧凑草稿,同时保持与原模型的兼容性以进行标准的推测验证。SDFP无需额外训练、超参数调优或单独维护的草稿,可实现快速、便于部署的草稿构建。在多项基准上,SDFP在不改变目标模型输出分布的情况下带来1.32倍至1.5倍的解码加速,支持低延迟多媒体应用。

SDFP:基于FIT剪枝模型的免训练即插即用LLM加速推测解码
图1:SDFP框架概览。SDFP整合了基于FIT的剪枝和投机解码,以实现对LLM的免训练、即插即用加速。在阶段1中,使用Fisher Information和参数扰动方差计算的FIT分数用于对层敏感度进行排序并剪除冗余层,得到一个紧凑的草稿模型。在阶段2中,剪枝后的模型作为草稿模型生成投机token,然后由基础模型进行验证。被接受的token被提交到输出,被拒绝的token则重新生成,从而在无需再训练的情况下实现高效解码。