论文

ViTeX-Bench:高保真视频场景文本编辑基准测试

ViTeX-Bench: Benchmarking High-Fidelity Video Scene Text Editing

模型评测基准与评测资源

摘要

最近的视频生成越来越真实和可控,但视频编辑仍然不够发达,特别是对于必须保留原始场景动态的精确本地编辑。视频场景文本编辑替换场景表面上的文本,例如店面标志、白板和产品标签,同时保留周围的内容、运动和摄像机动态。尽管针对图像的场景文本编辑已得到充分研究,但实现高视觉质量、时间一致性和编辑局部性的视频场景文本编辑仍有待探索。现有资源提供有限的配对真实视频数据,并且一般视频编辑指标不能直接衡量所请求的文本随着时间的推移是否保持正确。我们推出 ViTeX-Bench,这是一个包含 ViTeX-Dataset 和三轴评估协议的基准套件。该数据集包含 387 个真实世界的 720p 视频,带有文本区域掩码和编辑说明:230 个提供经过审核的、管道生成的配对编辑用于训练,157 个形成冻结评估分割。该协议评估文本正确性、视觉和时间质量,并通过 13 个指标编辑局部性,每个轴有一个主要指标,并对它们的权衡进行帕累托比较。 OCR 校准、人工评估和注释敏感性分析支持对这些分数的解释。在四个编辑系列的八个基线中,准确的文本、时间稳定性和场景保留仍然难以同时实现。我们还发布了 ViTeX-Edit-14B,这是一个开源参考编辑器,通过运动对齐字形视频调节对配对训练分割进行了微调。它达到了 CharAcc 0.688,这是评估的视频原生编辑器中最高的平均值,也是原始编辑器输出中最低的可比文本裁剪变形。 ViTeX-Bench 为研究视频场景文本编辑中的这些权衡提供了可重复的基础。