论文

AHPA:扩散的自适应分层先验对齐 Transformer

AHPA: Adaptive Hierarchical Prior Alignment for Diffusion Transformers

模型训练预训练

摘要

表示对齐最近已成为加速 Diffusion Transformer 训练的有效范例。尽管取得了成功,现有的对齐方法通常在整个去噪轨迹中施加固定的监督目标或固定的对齐粒度,无论指导是由外部视觉编码器、内部自我表示还是 VAE 衍生特征提供。我们认为,这种与时间步长无关的对齐方式不是最佳的,因为表示监督的有用粒度会随着信噪比而系统地变化。在高噪声情况下,扩散模型更多地受益于粗略语义和布局级锚定,而在低噪声情况下,训练信号应强调空间细节和结构忠实的细化。这种非平稳对齐行为会导致静态单级主管的表征不匹配。为了解决这个问题,我们提出了自适应分层先验对齐(AHPA),这是一种轻量级对齐框架,它利用了自然嵌入到冻结 VAE 编码器中的分层表示。 AHPA 不只使用单个压缩潜在变量作为对齐目标,而是提取多级 VAE 特征,这些特征提供从局部几何和空间拓扑到粗略语义布局的互补先验。时间步条件动态路由器沿着去噪轨迹自适应地选择和加权这些分层先验,从而使对齐粒度与模型不断变化的训练需求同步。大量实验表明,AHPA 比基线提高了收敛和生成质量,并且不会产生额外的推理成本,同时避免了训练期间的外部编码器监督。