论文

超越易读性:统一视频生成中视觉文本渲染和就地编辑的基准测试

Beyond Legibility: Benchmarking Visual Text Rendering and In-Place Editing in Unified Video Generation

模型评测基准与评测资源

摘要

视频可以展现令人信服的动作和真实感,但当视觉文本崩溃时就会立即失败。与一般场景内容不同,视觉文本在视频生成中是无情的:轻微的笔划损坏、时间不稳定或编辑错误会立即破坏易读性和真实感。现有基准测试将文本视为偶然事件或使用忽略时间动态的静态 OCR 指标,从而忽视了这一挑战。我们推出了 VidScribe,这是一个跨越四代机制的统一诊断基准:从语言编写 (T2V)、从参考转移文本身份 (R2V)、动态维持文本 (I2V) 和本地化文本编辑 (V2V)。 VidScribe 包含 12 轴条件正交因子空间中的 803 个经过人工验证的样本,涵盖内在文本属性、物理成像条件和时间行为。为了进行可靠的评估,我们在严格的可测量条件下构建了一个基于轨道的门控套件,其中包含 11 个共享指标和 2 个特定于任务的探针。对 11 个商业和开源系统进行基准测试表明,视频文本功能不是单一的,内容识别与笔划级字形正确性脱钩。性能与任务高度不对称:I2V 最可靠地维持文本,而 V2V 编辑是主要瓶颈。与直觉相反,退化集中在以文本为中心的结构和时间因素的一小部分,而不是不利的成像条件。进一步的调查表明,视觉参考提高了字形和印刷的保真度,而不是内容的准确性,而本地化编辑无法在不破坏未声明的源文本的情况下隔离目标文本。除了评估之外,VidScribe 还提供了可操作的训练信号,其中与基准一致的偏好优化可显着改善视觉文本生成。 https://huggingface.co/datasets/Vicky0720/VidScribe.