论文

走向无需训练场景文本编辑

Towards Training-Free Scene Text Editing

应用与实践内容创作

摘要

场景文本编辑旨在修改自然图像中的文本内容,同时保持视觉真实感和语义一致性。现有方法通常需要特定于任务的训练或配对数据,限制了它们的可扩展性和适应性。在本文中,我们提出了 TextFlow,一种 无需训练 场景文本编辑框架,它集成了注意力增强 (AttnBoost) 和流流形转向 (FMS) 的优势,无需额外训练即可实现灵活、高保真的文本操作。具体来说,FMS 通过对字符和背景区域的视觉流进行建模来保持结构和风格的一致性,而 AttnBoost 通过基于注意力的指导来增强文本内容的渲染。通过联合利用这些互补模块,我们的方法通过语义对齐和空间细化以即插即用的方式执行端到端文本编辑。大量的实验表明,我们的框架实现了与基于训练的框架相当或优于基于训练的框架的视觉质量和文本准确性,并且在不同的场景和语言中具有良好的泛化能力。这项研究将场景文本编辑推向更高效、更通用的 无需训练 范式。代码可在 https://github.com/lyb18758/TextFlow 获取