论文
ExtraVAR:阶段感知 RoPE 重新映射,用于视觉自回归模型中的分辨率外推
ExtraVAR: Stage-Aware RoPE Remapping for Resolution Extrapolation in Visual Autoregressive Models
摘要
视觉自回归 (VAR) 模型已成为图像合成扩散的有力替代方案,但其固定的训练分辨率无法以更高分辨率直接生成。将 无需训练 外推方法从 LLM 或扩散模型简单地转移到 VAR 会产生三种特征故障模式:全局重复、局部重复和细节退化。我们将它们追溯到统一的带级不匹配:VAR 在从粗到细、按比例缩放的过程中生成图像,其中每个阶段均由不同的主导 RoPE 频段驱动,并且当特定阶段的主导频段被破坏时,每种故障模式都会出现。基于这一见解,我们提出了阶段感知 RoPE 重新映射,这是一种 无需训练 策略,为每个频段分配特定于阶段的重新映射规则,共同抑制所有三种故障模式。我们进一步观察到,随着图像分辨率的提高,注意力会系统性地分散。现有方法通常依赖于预定义的注意力缩放因子,这些因子既不能适应目标分辨率,也不能忠实地捕获注意力分散的实际程度。因此,我们提出了熵驱动的自适应注意力校准,它通过分辨率不变的归一化熵来量化色散,并产生一个封闭形式的每头缩放因子,该因子将外推分辨率注意力熵与其训练分辨率对应物重新对齐。大量的实验表明,我们的方法在结构一致性和细节保真度方面始终优于先前的分辨率外推方法。我们的代码可在 https://github.com/feihongyan1/ExtraVAR 获取。