论文
VPG:自回归图像和视频生成的视觉前缀指南
VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation
摘要
自回归图像和视频生成器接受教师强制历史记录的训练,但必须在推理时从自己生成的前缀中进行采样,这使得它们容易受到曝光偏差和前缀漂移的影响。现有的补救措施要么修改训练,要么应用主要针对外部语义条件(例如类标签或文本提示)的采样时间指导,而不是测试下一步预测是否为生成的前缀本身提供强大的后验支持。我们提出了视觉前缀指导(VPG),这是一种用于自回归图像和视频生成的 无需训练 推理时间指导方法。 VPG 通过将生成的前缀下的模型输出与损坏的前缀下的输出进行对比,然后将 logits 外推到加强生成的前缀的后验支持的候选者,来改进下一步预测。在使用 VAR 生成类条件图像、使用 Infinity 生成文本到图像以及使用 InfinityStar 生成文本到视频时,VPG 无需重新训练基本模型即可提高生成质量,将 VAR 上的 FID 平均减少 0.36,并提高图像和视频生成的基准性能。