论文
LIVEeditor-14B:通过上下文稀疏注意力进行闪电统一视频编辑
LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention
摘要
视频编辑已经朝着上下文学习(ICL)范式发展,但由此产生的二次注意力成本造成了关键的计算瓶颈。在这项工作中,我们提出了上下文稀疏注意力(ISA),这是第一个为 ICL 视频编辑量身定制的近无损经验稀疏框架。我们的设计基于两个关键见解:首先,上下文标记的显着性明显低于源标记;其次,我们从理论上证明并实证验证查询清晰度与近似误差相关。受这些发现的启发,ISA 实施了一种有效的预选择策略来修剪冗余上下文,然后采用动态查询分组机制,将高错误查询路由到完全注意力,将低错误查询路由到计算高效的 0 阶泰勒稀疏注意力。此外,我们还构建了 \textbf{\texttt{LIVEditor-14B}} ,这是一种通过 ISA 的新型闪电视频编辑模型,以及一个提议的视频编辑数据管道,该管道生成了 170 万个高质量数据集。大量实验表明,LIVEeditor-14B 的注意力模块延迟降低了 $\sim$60%,同时超越了 EditVerseBench、IVE-Bench 和 VIE-Bench 的最先进方法,在不影响视觉保真度的情况下提供近乎无损的加速。