技术实践

淘天以精度对齐与复合量化部署多模态模型

模型推理模型优化AI 基础设施推理加速KV Cache量化模型部署

概述

淘天直播AIGC团队将面向电商直播的自研全模态理解大模型 TLiveOmni 部署到 vLLM:以 Plugin 方式注册自定义模型,修复多模态 Token 交替排布映射错位、去除 Audio token 自动 padding、对齐 deepstack 与 residual 的浮点相加顺序并替换 RMSNorm,消除训练/推理精度漂移;再用 SmoothQuant+GPTQ 复合量化配合 5000 条全模态校准集做后训练量化。实测各模态精度损失控制在 1.5% 以内,W8A8/FP8 综合加速 2.5x~3.5x,并给出 H20+FP8(长序列/生产)与 RTX 4090+W4A16(边缘/显存受限)两套部署策略。 后续材料(2026-05-20):TLiveOmni 1.0 是面向电商直播场景的全模态(Omni-modal)理解大模型,以图像、视频、文本、音频四模态统一输入、文本输出,支持 128K 上下文窗口。模型以 Qwen3-VL-Instruct 为核心基座,用 Qwen3-Omni 的 Audio Transformer(AuT,约 0.6B,在超过 2000 万小时多语言语音数据上预训练)作为音频编码器,并参照 Qwen3-VL 的 Vision DeepStack 设计 Audio DeepStack(两个线性层 + 激活函数层,取 Audio Encoder 第 8/16/24 层特征映射后融合进 LLM 前三层);时间编码沿用 Qwen3-VL 的格式化时间戳(如 <2.0 seconds>),并在 Audio tokens 与 Vision tokens 之间显式插入 <audio_start_token> 以建立模态边界。能力上构建了覆盖音频、视频、图像维度的超 20 项精细化原子能力,包括音频维度的语境感知 ASR 与多说话人分离、视频维度的商品时序切分与直播卖点提取、图像维度的商品空间定位与细粒度 OCR。训练采用「模态对齐→能力强化→全任务微调」三阶段范式,数据量分别为 500 万条语音-文本对、2600 万条音频数据、1376 万条跨模态数据。评测显示,在电商直播域的 ASR 与多说话人分离上达 SOTA,时序定位与视频密集描述达 SOTA,音频内容问答超过 Gemini2.5/3-Flash、接近 Gemini2.5-Pro,视频问答与分镜理解接近 Gemini2.5/3-Flash;上下文语音识别方面,关键词数量超过 200 时仍保持大于 75% 的召回率,50 个关键词时 ASR 效果相比无上下文提升 26%。 后续材料(2026-04-29):TLiveOmni 是面向电商直播场景打造的全模态理解大模型,原生支持图像、文本、音频、视频统一输入,实现 128K 上下文窗口,单次可解析长达 12 分钟直播视频流,构建覆盖音频(语境感知 ASR、多说话人分离)、视频(商品时序切分、直播卖点提取)、图像(商品空间定位、细粒度 OCR)的超 20 项原子能力;模型以 Qwen3-VL-Instruct 为基座,参照 Vision DeepStack 设计 Audio DeepStack 模块。