论文

StyleVAR:通过视觉自回归建模控制图像风格迁移

StyleVAR: Controllable Image Style Transfer via Visual Autoregressive Modeling

应用与实践内容创作

摘要

我们建立在视觉自回归建模(VAR)框架的基础上,并将风格迁移制定为学习潜在空间中的条件离散序列建模。图像被分解为多尺度表示,并通过 VQ-VAE 标记为离散代码;然后,Transformer 根据样式和内容标记对目标标记的分布进行自回归建模。为了注入风格和内容信息,我们引入了一种混合交叉注意机制,其中不断发展的目标表示关注其自己的历史,而风格和内容特征充当查询,决定要强调该历史的哪些方面。与尺度相关的混合系数控制每个阶段风格和内容的相对影响,鼓励综合表示与内容结构和风格纹理保持一致,而不破坏 VAR 的自回归连续性。我们从预训练的 VAR 检查点分两个阶段训练 StyleVAR:在内容-样式-目标图像的大型三元组数据集上监督 微调,然后使用组相对策略优化 (GRPO) 来针对基于 DreamSim 的感知奖励进行强化 微调,并使用每个动作归一化权重来重新平衡 VAR 多尺度层次结构中的信用。在分布内、近分布和分布外的三个基准中,StyleVAR 在风格损失、内容损失、LPIPS、SSIM、DreamSim 和 CLIP 相似性方面始终优于 AdaIN 基线,GRPO 阶段比 SFT 检查点产生更多收益,最显着的是在与奖励一致的感知指标上。定性地讲,该方法在保持语义结构的同时传输纹理,特别是对于风景和建筑场景,而互联网图像的泛化差距和人脸的困难凸显了对更好的内容多样性和更强的结构先验的需要。