小红书以动态视觉Token压缩优化问答首帧延迟
概述
「问一问」需从多篇图文笔记提炼关键信息并持续生成准确、连贯的答案,多图输入导致视觉 Token 膨胀,成为 TTFT 的核心计算瓶颈。团队观察到 ViT 深层特征已在少量 dominant token 上聚合主要信息、Decoder 对大量视觉 Token 关注度低,因此把 VisionZip 从论文方法转化为可部署的推理优化能力,并在 vLLM 中完成 Qwen2.5-VL、Qwen3-VL 与 Qwen3.5 的动态视觉 Token 剪枝适配:在视觉特征进入 LLM 前,从 ViT 指定层提取 Attention 统计信息、以每个视觉 Token 接收到的平均注意力衡量信息聚合能力;与逐图固定比例裁剪不同,同一请求内所有图片的视觉 Token 进入统一候选池、在全局 token budget 下竞争配额,OCR/文档/表格等信息密度更高的图片自动获得更多 Token(混合 1k OCRBench + 1k CCBench 实验中 OCRBench 图片保留率平均比 CCBench 高 13.6%);在线执行复用 FlashAttention 的 Softmax LSE,用定制 Triton Kernel 分块恢复局部 Attention Probability 并完成列方向重要性归约,不生成完整 Attention Matrix,同时适配 vLLM 多模态序列管理与位置编码逻辑(同步更新多模态输入长度、图片边界、原始空间索引与 mRoPE),使压缩后视觉序列无缝接入原有 Prefill、KV Cache 与 Decode 链路。收益:Qwen3-VL-32B 的 30 图样本裁剪 40% vision tokens 时 TTFT 从 687ms 降至 601ms(-13%),多项业务效果指标基本无损;RAG-IGBench 上保留 70%/60% vision tokens 时 Integrated Score 38.20%/37.48% 与 baseline 37.61% 基本持平,保留 50% 时降至 29.06%,因此默认采用裁剪 30%~40% 稳健档,并对 InfoVQA、复杂 OCR、表格生成等细节敏感场景降低压缩率。 后续材料(2026-08-05):MoE 稀疏性按 token 计算但线上按 batch 执行,Qwen3-30B-A3B 中 batch size 从 1 增至 128 时单层平均激活专家数从 8 增至 93.4,Decode 属 Memory-Bound、批内专家并集膨胀推高 TPOT。团队提出 SERE:不改权重、不重训练,先用少量通用数据离线按层计算专家 Frobenius 功能相似度矩阵(只算一次),在线时每层先汇总 batch 内所有 token 的 Top-K′ 主专家形成共享候选集,其余次级专家从整个 batch 的主专家中找最相似者并按相似度阈值重路由,相似度不足的关键专家仍按原路径计算,Router 权重与 Prefill 的 Top-K 保持不变,CUDA Graph、PD 分离与原部署参数也不变。落地侧把批内主专家汇总、最相似专家查找与保护位判断融合进单个 CUDA Kernel(warp 协作扫描规约、相似度矩阵与逐层 0/1 保护矩阵同形状连续布局、移除额外排序与 Host 同步),直接衔接 Fused MoE。收益:实际业务模型多图负载以 1000 个请求、相同 QPS 统计,TPOT 从 8.5ms 降至 7.1ms(-16.5%);公开 Qwen3-30B-A3B + OpenCompass 上 SERE K=2(ρ=0.5)准确率 80.37 vs 原始 Top-8 的 82.24(保留 97.7% 效果),TPOT 从 44.40ms 降至 32.82ms,而固定 Top-2 准确率仅 14.30,证明收益来自相似性引导的动态重路由;QPS=16 时 CUDA 版 SERE K=2 约 1.4×、K=1 约 1.6× 加速。Bad Case 治理:结构化表格生成中原始 K=2 的少量回归来自 Decode 后段尾部专家被逐层重路由,团队构建逐层 0/1 保护矩阵每层保护 16 个关键专家后指标由 80.5% 恢复至 83.9%(Baseline 84.9%),额外 TPOT 约 0.1ms;重路由算子经融合优化后在微基准相对初版提升约 4.1×(算子级,端到端 TPOT 收益仍为 16.5%)。