论文

无需训练 自回归视觉模型的语义校正

Training-Free Semantic Correction for Autoregressive Visual Models

模型推理推理验证与自校正

摘要

基于下一代预测的自回归视觉模型(AVM)已成为图像和视频合成的重要范例。然而,在 AVM 中将生成过程分解为具有不同粒度的离散尺度使得语义错误难以识别和纠正,从而损害了最终输出的质量。之前增强 AVM 的努力可以分为基于训练的方法和 无需训练 方法。尽管基于训练来提高 AVM 生成质量的努力需要大量的计算成本,但现有的 无需训练 方法忽略了中间生成状态,导致语义错误无法诊断并允许它们累积到最终输出中。在本文中,我们关注 无需训练 范式并提出 Gazer,这是一个将多模态 大语言模型 反馈集成到 AVM 采样循环中以进行代内语义校正的框架。具体来说,Gazer 通过两个协作阶段进行操作:反思诊断阶段从中间状态诊断语义错误,而语义纠正阶段则倒回并纠正生成轨迹以与目标提示重新对齐。组合图像和视频基准测试表明,Gazer 无需额外训练即可提高跨多个 AVM 的语义对齐和组合准确性。