论文

AcFlow:通过学习的条件激活流控制文本到图像的扩散 Transformer

AcFlow: Controlling Text-to-Image Diffusion Transformers via Learned Conditional Activation Flow

模型推理解码与生成控制

摘要

文本到图像扩散 Transformer (DiT) 是强大的生成器,但直接提示为风格强度提供了有限的控制界面,并且无法抑制不需要的概念。为了实现这些控制,我们引入了 AcFlow,这是一种推理时间控制器,它通过学习的概念条件速度场传输中间层图像词元激活,同时保持基本 DiT 冻结。文本概念描述指定所需的干预,而集成范围提供连续的控制参数。该字段产生词元变化的、依赖于激活的更新。通过每个任务族中概念之间共享的参数,该领域支持细粒度的描述,并概括到训练期间未见过的概念,而无需每个概念拟合。在风格控制方面,AcFlow 在高风格对齐机制中的评估基线中实现了最佳的风格与内容权衡。在固定操作点,AcFlow 实现了 0.5365/0.2860 的样式-内容对齐,而具有最高样式对齐的基线为 0.4397/0.2684。定性结果表明对不同概念的抑制,包括直接提示失败的情况。我们的分析支持将学习的速度场作为自适应控制机制,更新方向因词元而异,并取决于其激活状态。我们的代码可在 https://github.com/Nove1yst/AcFlow 获取。