论文
VTR-Bench:评估视频生成中视觉文本渲染的系统基准
VTR-Bench: A Systematic Benchmark for Evaluating Visual Text Rendering in Video Generation
摘要
最近的视频生成模型可以根据自然语言指令生成高度逼真的视频,其视觉质量接近电影标准。然而,现有的评估基准主要评估视觉质量、审美吸引力和物理合理性,而对文本(日常场景中传递信息的重要媒介)的关注有限。生成的视频可能看起来具有视觉吸引力并具有逼真的主题,但仍然无法正确渲染场景中的文本。为了解决这个被忽视的维度,我们引入了 VTR-Bench,这是一个用于评估视频生成模型的 Visual Text Rendering 功能的系统基准。 VTR-Bench 将文本置于广告和科学视频等具体应用场景中,并提供涵盖 5 个场景类别的 300 个精心构建的提示。我们开发了一种具有人类对齐的自动评估管道,可以通过特定于载体的转录来单独评估文本保真度,并通过特定于提示的查询链来评估场景和运动要求。除了评估之外,我们还引入了 Keyframe-Guided Agentic Framework,其中 Director Agent通过视觉评估协调图像和视频生成,通过视觉反馈指导迭代细化和候选选择。对 11 个最先进模型的实验揭示了准确渲染场景文本时存在的普遍困难,其中表现最好的模型的总体错误率 (WER) 为 0.250。我们进一步分析文本渲染失败,以描述当前视频生成模型面临的挑战。这些发现强调了视觉文本渲染是视频生成的关键挑战,并展示了改进的实用途径。代码可在 https://github.com/hardenyu21/VTR-Bench. 获取