论文

视觉自回归生成的对抗性纠错

Adversarial Error Correction for Visual Autoregressive Generation

模型推理解码与生成控制

摘要

视觉自回归 (VAR) 模型通过执行分层的下一尺度预测,已成为图像合成的强大范例。然而,VAR 模型本质上容易出现级联误差传播,其中微妙的粗尺度错误预测在整个层次结构中被放大,最终扭曲最终的合成。为了缓解这一问题,我们提出了 AID-VAR,这是一种即插即用的框架,可以通过对抗性注入诊断来增强预训练的 VAR。 AID-VAR 不是标准的被动生成,而是引入了受 GAN 中对抗性反馈启发的主动纠错机制。我们部署一个鉴别器来诊断每个尺度转换时的保真度差距,再加上一个轻量级引导注入器。该模块作为非侵入式适配器运行,可细化冻结 VAR 主干的特征流,有效地引导生成过程走向真实图像的分布,而不会破坏预先训练的潜在空间的稳定性。此外,为了严格评估这种跨尺度进展,我们引入了尺度间一致性得分(ISCS),这是一种量化连续分辨率尺度之间的保真度和结构对齐的新颖指标。各种主干网的实验结果表明,AID-VAR 可提供更清晰的纹理细节和更少的结构扭曲,且开销可以忽略不计。例如,AID-VAR-d20 在参数仅增加 3% 的情况下,FID 提高了 16%。这些结果将 AID-VAR 确立为一种高效且可扩展的途径,用于升级大规模 VAR 生成器,增强全局一致性和局部细节,而无需改变训练数据、基础架构或采样计划。代码可在 https://github.com/bijiw515/AID-VAR 获取。