技术实践

淘天以定制vLLM和量化加速TLiveOmni推理

模型推理模型优化AI 基础设施推理加速量化模型服务框架

概述

在 TLiveOmni 1.0 的生产环境落地中,团队选择 vLLM 作为核心推理框架(PagedAttention 使显存碎片率降低 30% 以上、Continuous Batching 提升高并发吞吐、兼容 OpenAI API 规范)。针对 vLLM 在长视频输入下的引擎死锁(#28375)与多模态精度大幅下降(#29595)、v1 对 Omni 模型支持不完整(#30776)以及训练端 ms-swift 与部署端 vLLM 实现方式不同导致的精度漂移三类问题,团队基于 vLLM v1 做了定制化改造:架构层实现 TLiveOmni 特有的 Token 排布逻辑与 MRoPE 计算、为音频添加数据标准化与 DeepStack 结构。 算子层重构 Norm 算子以修正与 Transformers 的计算差异、重新排列 GPU 浮点加法顺序防止 Residual 过大导致小值丢失、修复音频模块缓存对齐导致的序列自动填充,使推理序列长度与训练完全一致,改造后 vLLM 推理精度与 torch 推理精度基本对齐。量化上采用 SmoothQuant + GPTQ 复合方案,并按任务完整性、任务敏感性(OCR、Grounding 等敏感任务给更多样本权重)、模态完整性三条原则抽取校准集,最终形成 5000 条高质量数据校准池(GPU 为 H20*1,量化方案 INT8、FP8)。 实测 8bit 量化下的 TLiveOmni 1.0 在保持各模态任务效果几乎不掉点的同时,单样本推理取得 2.5-3.5 倍加速。