论文

VISTA:视觉自回归生成的测试时组合对齐

VISTA: Test-Time Compositional Alignment for Visual Autoregressive Generation

模型推理解码与生成控制

摘要

视觉自回归 (VAR) 模型已成为文本到图像生成扩散的快速、高质量替代方案,但与扩散模型一样,它们表现出持续的构图失败,生成的图像违反了提示中指定的属性绑定和空间关系。虽然已经开发了一系列丰富的测试时间对齐方法用于扩散,但对于下一代 VAR 生成,不存在类似的方法,其状态、离散、多分辨率采样过程使得现有技术不适用。我们用 \textbf{VISTA} (\textbf{Vi}sual Autoregressive \textbf{S}emantic \textbf{T}est-time \textbf{A}lignment)缩小了这一差距,这是第一个用于下一代自回归图像生成的基于梯度的测试时间对齐框架。 VISTA 基于 Infinity 构建,直接干预生成过程,通过冻结的 Transformer 优化中间表示,以引导视觉预测达到成分约束,无需修改模型参数或需要额外的训练。 VISTA 引入了使这种优化跨尺度稳定所需的机制,以及可扩展的目标空间,交叉注意力的任何可微分约束都可以插入其中。在两个基准和两个模型尺度上,VISTA 改进了每个目标组合类别,在 2B 主干上将平均目标分数提高了近 20%,在 8B 主干上提高了近 6%,其中空间关系的增益最大。图像质量得以保留:独立偏好模型 VISTA 从未优化,其输出得分高出近 20%。值得注意的是,采用 VISTA 的 2B 模型超过了其大小四倍的主干网,这表明模型尺度之间的组成差距的很大一部分在测试时是可以恢复的。