论文

DynamicRad:长视频扩散的内容自适应稀疏注意力

DynamicRad: Content-Adaptive Sparse Attention for Long Video Diffusion

模型推理推理加速

摘要

利用视频扩散中的自然时空能量衰减提供了一条提高效率的途径,但仅依赖刚性静态掩模可能会丢失复杂动态中的关键远程信息。为了解决这个问题,我们提出了 \textbf{DynamicRad},这是一种统一的稀疏注意力范式,它将自适应选择建立在径向局部先验的基础上。 DynamicRad 引入了 \textbf{双模式} 策略:\textit{static-ratio} 用于速度优化执行,\textit{dynamic-threshold} 用于质量优先过滤。为了确保鲁棒性而无需在线搜索开销,我们集成了离线贝叶斯优化(BO)管道和\textbf{语义运动路由器}。这个轻量级投影模块将提示嵌入映射到具有\textbf{最小运行​​时开销}的最佳稀疏状态。与在线分析方法不同,我们的离线 BO 在基于物理的代理任务上优化了注意力重建误差 (MSE),确保快速收敛。在 HunyuanVideo 和 Wan2.1-14B 上的实验表明,DynamicRad 推动了效率-质量 Pareto 前沿,实现了 \textbf{1.7$\times$--2.5$\times$ 推理加速}和 \textbf{超过 80\% 的有效稀疏度}。在某些长序列设置中,动态模式甚至匹配或超过密集基线,而掩模感知 LoRA 进一步提高了长视野相干性。代码可在 https://github.com/Adamlong3/DynamicRad 获取。