论文

救赎在于:在逐步蒸馏的扩散模型中引发固有的风格转移

Salvation Lies Within: Eliciting Inherent Style Transfer in Step-Distilled Diffusion Models

应用与实践内容创作

摘要

通过后训练调整分步蒸馏文本到图像 (T2I) 模型会产生额外的计算成本,并影响本机的几步生成行为。这激发了超越特定风格适应的补充路线:利用已经在逐步提炼的 T2I 模型中编码的视觉知识,通过语言引发风格能力。追求这个方向需要文本指导来捕获视觉属性如何共同定义样式并在所描述的内容发生变化时保持适用。为了探索这种方法,我们引入了 StyleForge,这是一个全自动的无需训练框架,它将参考样式表示为可重用的渲染指令。通过将整体渲染特征与局部颜色和照明行为相结合,StyleForge 将参考图像中的视觉证据组织成如何表达目标风格的连贯规范。然后,该规范被编译成文本指南,可以在内容提示中重复使用,从而使冻结的逐步蒸馏 T2I 模型能够以参考风格渲染不同的主题和场景,同时保留本机的几步生成。广泛的实验表明,与最强的基线相比,生成质量分数的相对增益高达 29.47%,而帕累托分析表明,改进的风格化伴随着对所请求内容的强烈遵守。

救赎在于:在逐步蒸馏的扩散模型中引发固有的风格转移的原论文方法或结果图
图 2:StyleForge 概述。 (1) 智能体从参考图像中提取结构化风格证据。 (2) 颜色和亮度统计为提取的证据奠定基础。 (3)智能体编译了可重用的风格提示,并将其与新的内容提示相结合,以指导逐步蒸馏的T2I模型。