论文
在第零步看到终点:经MLP稀疏感知截断加速扩散多模态大模型
Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation
摘要
扩散多模态大语言模型(DMLLM)对多模态推理高度有效,但其推理效率被固定长度生成约束显著拖累。由于实际输出长度未知,输出序列被填充到预定义最大长度——在多余的[EOS] token上产生大量冗余计算。本工作中我们发现:DMLLM在第一个去噪步就经MLP激活稀疏性的独特偏移隐式揭示其有效语义边界。利用该观察,我们提出Seer:一个免训练框架——以基于信噪比(SNR)的准则检测该边界,并对所有后续计算一次性截断冗余后缀。为在批量serving中保留这些理论增益,Seer纳入混合执行策略:在无缝容纳动态序列长度的同时最大化吞吐。实验结果表明Seer有效消除填充浪费、把吞吐加速最高约31倍;跨9个基准,Seer稳健保持总体表现,甚至通过缓解噪声泄漏改善复杂视觉任务的准确率(如DocVQA分数从63.52升至63.66)——为DMLLM加速提供高效、即插即用的方案。
