论文

SUN:共享使用下一词预测以实现高效多 LLM 分离式服务

SUN: Shared Use of Next-token Prediction for Efficient Multi-LLM Disaggregated Serving

AI 基础设施推理服务

摘要

在多模型 LLM 服务中,解码执行因按模型划分资源而低效:由于无法跨模型批处理,访存受限的解码常遭遇严重 GPU 利用不足,负载倾斜时尤甚。我们提出 Shared Use of Next-token Prediction(SUN),首个在分离式多 LLM 服务中实现跨模型共享解码执行的方法。SUN 把仅解码器 Transformer 分解为 prefill 模块与 decode 模块,只微调任务专属 prefill 模块,使冻结的 decode 模块可跨模型共享。这一设计支持模型无关的解码路由策略,把解码请求均衡分配到共享工作节点以最大化利用率。跨多样任务与模型家族,SUN 取得与全量微调相当的精度,同时以更少解码工作节点维持系统吞吐。特别地,SUN 较传统分离式方案把每 GPU 吞吐最高提升 2.0 倍,同时将每输出 token 时间(TPOT)控制在 5% 以内。SUN 天然支持并促进低位宽解码;配合量化 SUN(QSUN),在保持与 SUN 相当精度和共享解码优势的同时实现 45% 加速。

SUN:共享使用下一词预测以实现高效多 LLM 分离式服务
图1:面向解耦式多LLM服务的SUN概览。(左):在传统解耦式服务中,解码worker按模型相互隔离,导致GPU持续利用不足,在偏斜的多模型负载下尤以内存受限的解码执行为甚。(右):SUN通过微调任务特定的预填充(prefill)模块,实现不同微调模型之间共享一个冻结的解码模块。该设计提升了GPU利用率,并降低了总拥有成本(TCO)。