论文

SonicSampler:面向LLM采样与投机验证的统一tile感知内核

SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification

模型推理推理加速

摘要

LLM推理中的采样由logit处理、token选择与投机解码验证操作组成一个组合集合。但现有实现要么只加速该管线的子集,要么依赖多次内核启动,要么假设批内采样行为同质——限制对动态服务工作负载的支持并阻碍高效CUDA Graph执行。我们提出SonicSampler,一套统一的tile感知Triton内核套件:把完整采样管线纵向融合为固定、负载感知的执行模型。其内核在单个批内核内支持动态逐请求采样行为——语法约束解码、重复/频率/存在惩罚、logit偏置、温度缩放、top-k/top-p/min-p过滤与投机验证——同时完全兼容CUDA Graph。方法核心是新颖的分层两阶段top-k算法:较竞争基线最高10倍加速,并利用LLM输出的低熵结构实现大词表上的高效选择。跨异构投机解码工作负载,SonicSampler较最先进基线最高16倍加速,同时保持灵活的批量执行。

SonicSampler:面向LLM采样与投机验证的统一tile感知内核:论文配图
图 1:SonicSampler 针对单一(非推测)工作负载的两级切片感知融合采样管道。第 1 阶段(顶部,从左到右)通过优化 Bitonic 或自适应 Radix-Bitonic 选择(右图),将语法屏蔽、重复惩罚、logit 偏差和温度缩放与词典编码和每个图块本地 Top-kk 垂直融合,仅将每个图块的打包 kk 结果写入 HBM 暂存器,作为唯一的跨内核内存边界。第 2 阶段(底部,从右到左)跨图块重新索引,通过具有升序/降序交替图块布局的双调合并网络执行全局 Top-kk 缩减,应用概率截断,并通过 Gumbel-Noise 和 ArgMax 发出选定的令牌,通过共享 HBM 带完成顺时针数据循环。自适应基数-双调策略(右)通过单通道优化归约树筛选 6 个最高有效位,分支到较低 10 位上的 2 通道基数选择或回退到优化双调选择。