TokTier:用于代理 LLM 服务的精确状态 CPU+GPU 词元化
TokTier: Exact Stateful CPU+GPU Tokenization for Agentic LLM Serving
摘要
LLM 服务缓存提示 KV 状态,但大多数前端仍然在每次调用时重新标记完整请求。 编码智能体 付出最多:会话在小追加后重复提交长记录,这可以在前一个序列末尾附近移动词元边界。在 153,951 次调用中,追加的中位数约为 1.4K 个字符;只有 1.0-3.6% 的调用启动或重建会话,但这些调用携带数百万个字符的上下文。队列提示缓存命中率为 94.1%,当接近 0.99 时,在组件测量中,标记化从第一个标记时间 (TTFT) 的 10% 增长到 64%。 TokTier 是针对这种两种模式工作负载的有状态 CPU+GPU 标记化服务,在一个合同下:发出的标记 ID 始终与完整参考标记化相同。对于会话延续,仅当每个请求检查找到稳定的预标记化边界时,它才会重新标记附加和拼接周围的小窗口;失败的检查会扩大窗口或退回到完全参考标记化。对于没有可重用前缀的调用,它在 GPU 上运行精确的 GPT 系列正则表达式预标记化和 BPE。采样影子验证器重新检查实时流量。在 17 个生产标记器系列中,差异化活动涵盖 1.5x10^10 分割检查、12.4 TB 真实文本语料库和 93,000 多个重播的代理步骤,且差异为零。增量修复从 100K 到 3M 字符需要 0.5-1.1 毫秒,比 HF 标记化快 437 倍,在 1M 字符时比完全预热的基于缓存的最强基线 (Gigatoken) 快 2.1 倍。 GPU 标记化在 0.87 毫秒内编码 1M 字符请求,比 HF 低 491 倍,比同一协议上最快的已发布 CPU 方法低 23.4 倍。使用 vLLM,在记录的突发情况下,中位 TTFT 下降 16-34%,P99 TTFT 下降 23%。在 50 毫秒 P99 目标下,四核修复池加 1 个 GPU 可维持 1,821 个请求/秒,其中 16 核无状态前端在 40 个请求/秒时饱和。