论文

HetA-DiT:按 token 去噪难度分配视频注意力

Where Compute Matters: Heterogeneous Attention for Efficient Video Diffusion

模型推理模型架构Transformer推理加速

摘要

高效的视频生成需要减少长时空词元序列上自注意力的二次成本。现有的高效注意力方法通常对每个标记应用相同的计算模式,尽管去噪难度在视频区域之间有很大差异,并且在整个生成过程中不断演变。我们引入了 HetA-DiT,这是一种异构注意力机制,可以根据 token 难度自适应地分配计算。轻量级不确定性分支预测去噪难度的逐个标记估计,用于通过密集的全局注意力路由不确定的标记,同时通过有效的局部注意力处理更可靠的标记。由此产生的路由是内容和时间步自适应的,保留最重要的全局上下文,并提供用于控制质量效率权衡的单个参数。 HetA-DiT 与少步分布匹配蒸馏兼容,并且通过重用前面去噪步骤的不确定性估计,在推理时不引入额外的 Transformer 评估。我们在 DMD 蒸馏的 Wan2.2-5B 和 Wan2.1-1.3B 模型上评估该方法。在 VBench、VBench-2.0 和人类偏好评估中,HetA-DiT 保持有竞争力的生成质量,同时通过密集注意力仅路由大约 20% 的token。