论文
头部强迫:通过头部异质性生成长自回归视频
Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity
摘要
自回归视频扩散模型支持实时合成,但长期会遭受错误累积和上下文丢失的影响。我们发现 AR 视频扩散 Transformer 中的注意力头在功能上起着不同的作用,例如用于细节细化的本地头、用于结构稳定的锚头和用于远程上下文聚合的内存头,但现有方法对它们进行统一处理,导致 KV 缓存分配不理想。我们提出了 Head Forcing,这是一种 无需训练 框架,它为每种头类型分配定制的 KV 缓存策略:本地头和锚头仅保留必要的词元,而内存头采用具有动态片段更新的分层内存系统以实现远程一致性。 Head-wise RoPE 重新编码方案进一步确保位置编码保持在预训练范围内。无需额外训练,Head Forcing 将生成时间从 5 秒延长至分钟级持续时间,支持多提示交互式合成,并始终优于现有基线。项目页面:https://jiahaotian-sjtu.github.io/headforcing.github.io/。