论文
SDFP:基于FIT剪枝模型的免训练即插即用LLM加速推测解码
SDFP: Speculative Decoding with FIT-Pruned Models for Training-Free and Plug-and-Play LLM Acceleration
摘要
大语言模型(LLM)支撑着字幕生成、检索、推荐和创意内容生成等交互式多媒体应用,但其自回归解码带来显著延迟。推测解码利用轻量草稿模型降低延迟,但部署常受限于获取、调优和维护有效草稿模型的成本与复杂性。近期方法通常需要辅助训练或专门化,即使是免训练方法也需要代价高昂的搜索或优化。我们提出SDFP,一个完全免训练、即插即用的框架,通过对给定LLM进行基于Fisher信息迹(FIT)的层剪枝来构建草稿模型。SDFP以层敏感度作为输出扰动的代理,移除低影响层以获得紧凑草稿,同时保持与原模型的兼容性以进行标准的推测验证。SDFP无需额外训练、超参数调优或单独维护的草稿,可实现快速、便于部署的草稿构建。在多项基准上,SDFP在不改变目标模型输出分布的情况下带来1.32倍至1.5倍的解码加速,支持低延迟多媒体应用。
