论文
将图像风格训练压缩为单个模型
Compressing Image Style Training into a Single Model Forward
摘要
基于扩散的风格迁移必须平衡推理效率和风格化保真度。基于适配器的方法很有效,但它们将样式作为外部条件注入,并且可以削弱特定于参考的外观或将参考语义复制到生成的图像中。基于优化的个性化方法(例如 LoRA)可以更有效地内化风格,但需要针对每种新风格进行单独的训练过程。我们引入了 i2L(图像到 LoRA),这是一个将 LoRA 训练风格分摊到单个前向传递中的框架。给定一张或多张参考图像,i2L 可以预测文本到图像模型的 LoRA 权重,从而无需针对每种样式进行优化即可立即进行样式实例化。该架构结合了图像编码器、可学习的 LoRA 查询和生成自适应矩阵的压缩解码头。对语义多样化风格对的训练鼓励预测器保留外观线索,同时抑制参考内容复制。 Z-Image、FLUX.2 和 Hidream-O1 上的实验表明,i2L 比现有基线提高了风格保真度、提示对齐和感知质量。由于 i2L 产生显式 LoRA 权重,因此它还支持非对称无分类器指导、多参考风格融合以及与可控生成模块的组合。