论文
DIET:视频扩散Transformer的删除响应专家修剪
DIET: Deletion-response Expert Trimming for Video Diffusion Transformers
摘要
视频扩散Transformer (DiT) 越来越多地采用专家混合 (MoE) 架构来减少主动计算,但其完整的专家存储仍然昂贵。现有的一次性剪枝标准主要依赖于静态激活或路由统计,无法捕获专家删除后的层级重路由。 我们提出DIET,这是一个基于删除响应的免训练专家剪枝框架。一次使用全部专家的校准前向计算,为匹配的条件与无条件词元记录专家输出及路由状态。随后利用缓存张量重放候选删除操作,无需额外的模型前向计算。得到的删除响应特征通过移除专家引起的变化刻画各个专家。 DIET 通过最小化总体多样性损失 (ODL) 来选择保留的专家,从而保留签名空间中的方向覆盖,并将层内本地搜索与层间回归引导的预算搜索相结合,以跨层分配专家。在 LingBot-Video 30B-A3B 上,剪枝 50% 的专家(6,144 到 3,072),将检查点从 57 GB 减少到 30 GB,并且无需微调即可在 48 GB GPU 上实现单卡部署。 Under a fixed 284-case VBench protocol, the VBench Total increases from 0.7941 to 0.8115. 在测试的各档专家保留预算下,DIET均优于由大语言模型方法适配而来的强剪枝基线。