论文
SUN:共享使用下一词预测以实现高效多 LLM 分离式服务
SUN: Shared Use of Next-token Prediction for Efficient Multi-LLM Disaggregated Serving
摘要
在多模型 LLM 服务中,解码执行因按模型划分资源而低效:由于无法跨模型批处理,访存受限的解码常遭遇严重 GPU 利用不足,负载倾斜时尤甚。我们提出 Shared Use of Next-token Prediction(SUN),首个在分离式多 LLM 服务中实现跨模型共享解码执行的方法。SUN 把仅解码器 Transformer 分解为 prefill 模块与 decode 模块,只微调任务专属 prefill 模块,使冻结的 decode 模块可跨模型共享。这一设计支持模型无关的解码路由策略,把解码请求均衡分配到共享工作节点以最大化利用率。跨多样任务与模型家族,SUN 取得与全量微调相当的精度,同时以更少解码工作节点维持系统吞吐。特别地,SUN 较传统分离式方案把每 GPU 吞吐最高提升 2.0 倍,同时将每输出 token 时间(TPOT)控制在 5% 以内。SUN 天然支持并促进低位宽解码;配合量化 SUN(QSUN),在保持与 SUN 相当精度和共享解码优势的同时实现 45% 加速。
