论文

在第零步看到终点:经MLP稀疏感知截断加速扩散多模态大模型

Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation

模型推理推理加速

摘要

扩散多模态大语言模型(DMLLM)对多模态推理高度有效,但其推理效率被固定长度生成约束显著拖累。由于实际输出长度未知,输出序列被填充到预定义最大长度——在多余的[EOS] token上产生大量冗余计算。本工作中我们发现:DMLLM在第一个去噪步就经MLP激活稀疏性的独特偏移隐式揭示其有效语义边界。利用该观察,我们提出Seer:一个免训练框架——以基于信噪比(SNR)的准则检测该边界,并对所有后续计算一次性截断冗余后缀。为在批量serving中保留这些理论增益,Seer纳入混合执行策略:在无缝容纳动态序列长度的同时最大化吞吐。实验结果表明Seer有效消除填充浪费、把吞吐加速最高约31倍;跨9个基准,Seer稳健保持总体表现,甚至通过缓解噪声泄漏改善复杂视觉任务的准确率(如DocVQA分数从63.52升至63.66)——为DMLLM加速提供高效、即插即用的方案。

在第零步看到终点:经MLP稀疏感知截断加速扩散多模态大模型:论文配图
图 1. DMLLM 中“填充诅咒”的图示。由于固定长度的生成窗口,一个简短的语义有效响应不可避免地会跟随大量的冗余填充标记序列(例如,<|endoftext|>),导致严重的计算浪费。下图说明了扩散多模态大型语言模型中的“填充诅咒”。它显示了对篮球图像生成的简短文本响应,然后是一个非常长的冗余文本结尾填充标记序列,填充了预定义的固定长度窗口,代表计算浪费。