论文
FontFusion:通过排版调节增强扩散模型中的生成文本
FontFusion: Enhancing Generative Text in Diffusion Models with Typographic Conditioning
摘要
扩散模型中的版式生成面临着持续的权衡:启用精确的字体控制通常会降低文本的易读性,而保持可读性通常会牺牲版式保真度。我们提出了 FontFusion,这是一种用于 Diffusion Transformer (DiT) 架构的即插即用调节框架,它通过三个核心创新解决了这一困境:(1) 在多个粒度上建立显式文本-字体关系的分层词元表示,(2) 在版式和图像内容之间创建空间绑定的位置感知嵌入,以及 (3) 提高计算效率和对不可见字体的泛化的多级词元丢弃策略。我们对字体嵌入空间的系统评估表明,结合 DeepFont 和 DINOv2 的双编码器在排版任务方面优于任何单个编码器。 FontFusion 表现出,与单编码器基线相比,具有挑战性的装饰字体相对提高了 76%,字体一致性比无条件模型提高了约 68-76%,同时无需重新训练即可集成到现有 DiT 架构中。