论文

SynVAR:在视觉自回归模型中协同空间和语义对齐

SynVAR: Synergizing Spatial and Semantic Alignment in Visual Autoregressive Model

模型推理解码与生成控制

摘要

VAR 由于其下一代预测范式而获得了广泛的流行。然而,在处理具有多个对象和属性的复杂场景时,它面临着巨大的性能瓶颈。现有的基于扩散的增强方法无法充分解决 VAR 中跨尺度误差传播和累积的独特挑战。为此,我们提出了SynVAR,第一个专为VAR范式量身定制的无需训练增强框架,它引入了空间语义协同控制策略,以有效抑制传播误差并提高生成质量。 SynVAR由三个关键组成部分组成:(1)全局指导,以确保早期阶段合理的空间结构,(2)感受野约束,以减轻早期语义混乱,(3)高频补偿,以恢复细粒度细节。大量的定量和定性实验证明了SynVAR在增强VAR复杂场景建模能力方面的显着改进。