论文

Sol-Attn:通过动态注意力稀疏化加速视频生成推理

Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

模型推理推理加速

摘要

扩散 Transformer 对于高保真视频生成至关重要,但长标记序列使注意力成为主要的推理瓶颈。 无需训练 动态稀疏注意力通过仅计算选定的键值块来缓解这一瓶颈,但现有方法难以有效且准确地稀疏注意力,原因有两个:(1)刚性、不可预测且成本高昂的路由:通过代理分数选择排名靠前的块的固定比例会施加固定预算,而保留块以达到目标累积代理概率质量会产生动态但可能不平衡的预算;两者都会因计算和具体化代理分数而产生不可忽略的开销。 (2) 有损保留或丢弃稀疏化:未选择的块被完全丢弃,在严重稀疏性下降低了精度。这些限制促使更便宜的动态预算路由,同时限制精度下降。在本文中,我们引入了无需训练 Sol-Attn(稀疏在线注意力),它将动态路由、稀疏计算和近似校正统一在单个在线softmax通道中,在稀疏注意力中实现了更好的精度-效率权衡。 Sol-Attn 的核心是具有代理分数重用的动态块阈值处理,它通过在在线 softmax 期间将块代理分数与阈值进行比较来选择关键块。这种设计可以实现动态但可控的块预算,而无需具体化代理图,同时直接重用未选定块的代理分数来近似其贡献。跨图像和视频生成任务的实验表明,Sol-Attn 推进了 无需训练 稀疏注意力的质量效率前沿,分别为视频生成和编辑提供 2.1 倍和 2.3 倍的端到端加速,同时保持视觉质量。