论文

视频扩散训练中少数时间注意力头形成局部路由结构

Temporal-Attention Head Specialization During Video Diffusion Training

模型评测模型行为与机制分析

摘要

视频扩散Transformer依赖时间注意力协调跨帧信息,但现有认识几乎都来自已训练模型,时间注意力结构在训练中何时、何处形成仍不清楚。总体均值也可能掩盖这种结构,因为少数专化头与多数扩散头在均值中相互抵消。因此,我们对九次Open-Sora STDiT训练运行的每个时间注意力头开展逐检查点普查,覆盖306M至1.03B的三个模型规模,在预注册变点及效应量选择规则下,用熵归一化的跨帧注意力集中度(CFAC)评分。普查揭示均值所掩盖的稀疏图景:每次运行的总体CFAC均平坦或下降,而完整网格运行中约4%至13%的少数头形成明显集中。跨随机种子可复现的信号位于块级位置;选中头反复出现在第一个时间块,但控制块归属后,单个头坐标并不可复现。在分析的760M模型选中头中,注意力图收敛到少量局部帧路由模式,包括自身帧对角线和相邻帧条带,即使对应坐标在不同运行中不同。相关与消融分析未建立其与生成视频质量的因果联系,我们据此限定主张。除这一STDiT家族外,本研究提供可迁移方法:固定选择规则下的逐检查点、逐头分析,可以揭示其他分解式视频扩散Transformer中的稀疏时间组织;调整路由指标后,也可用于联合时空架构。