论文

SteerVTE:具有样式和字形控制的无缝视频文本编辑

SteerVTE: Seamless Video Text Editing with Style and Glyph Control

应用与实践内容创作

摘要

视觉文本编辑旨在精确修改图像和视频中的文本,同时保持风格一致性和视觉真实感。尽管图像领域取得了重大进展,但视频文本编辑在很大程度上仍未得到探索:它是一项本地化任务,需要在小文本区域内实现笔画级精度,这加剧了跨帧准确性、时间连贯性和风格保真度的挑战。我们引入 SteerVTE,一个统一的框架,\underline{\textbf{steer}} 是一个冻结视频扩散模型,通过样式和字形控制执行精确的 \underline{\textbf{V}}ideo \underline{\textbf{T}}ext \underline{\textbf{E}}编辑。 SteerVTE 基于冻结扩散 Transformer 构建,附加了一个带有两个互补模块的轻量级文本上下文适配器:捕获原始文本视觉属性的样式编码器,以及在行和字符级别对目标文本进行编码的双粒度字形编码器。为了克服视频基础模型固有的弱文本渲染先验,我们进一步提出了一种字形感知的空间焦点损失和一个从图像数据扩展到视频数据的三阶段渐进训练课程。为了支持大规模训练,我们还开发了自动合成管道并构建了 SteerVTE-1M,这是一个包含一百万个三元组的数据集,涵盖不同的场景、字体和风格效果。大量实验表明,SteerVTE 在文本准确性、风格一致性和时间连贯性方面远远优于现有的视频编辑基线。