论文
用于高效视频生成的 Token Radius Attention
Token Radius Attention for Efficient Video Generation
摘要
视频扩散 Transformer (VDiTs) 可实现高保真生成,但会因密集 3D 自注意力而产生二次成本。现有的头级和块级稀疏方法在查询之间共享计算预算,忽略了特定于词元的注意力需求。我们观察到保留密度在不同查询之间有所不同,但与注意力熵呈对数线性相关,而主导交互形成具有词元相关半径的以查询为中心的邻域。基于这些发现,我们提出了 Token Radius Attention (TRA),这是一个 无需训练 框架,它将查询熵映射到分析 词元预算 并将其转换为时间衰减半径,而无需明确的键排名。融合熵提取、预热重用和块稀疏掩模构造进一步减少了开销。在 7 个 Wan2.1、Wan2.2 和 HunyuanVideo T2V/I2V 配置中,TRA 仅保留 9-19% 的注意力交互,并以具有竞争力的生成质量实现 1.56x-2.05x 的加速。代码可在 https://github.com/IF-LAB-PKU/Token-Radius-Attention 获取。