论文
视频生成即时增强器的统一评估
Towards Unified Evaluation of Prompt Enhancers for Video Generation
摘要
现代视频生成器可以实现日益复杂的视觉叙事,将提示增强器 (PE) 定位为从简洁的用户指令和多模态参考到结构化电影计划的关键桥梁。然而,现有的 PE 评估依赖于渲染视频,这会带来大量的计算和人力成本,减慢 PE 训练和迭代速度,并将 PE 质量与下游生成器行为混为一谈。为了弥补这一差距,我们推出了 PEBench,这是第一个跨文本到视频、图像到视频和参考到视频提示增强直接进行 PE 评估的统一基准。它包含 1,100 个经过专家验证的案例和 1,005 个视觉资产,涵盖 35 项细粒度任务,具有不同的时间、电影、视听和多参考要求。此外,我们还开发了 PEBench 评估,这是一个基于证据的框架,将模态感知事实提取与跨 24 个标准的基于标题的评估相结合。我们对代表性开源和闭源 PE 方法的系统评估揭示了细粒度描述性扩展的新转变 朝着保留意图的电影规划,而字幕重建和前向细化方法分别在电影覆盖范围和语义保真度或内部连贯性方面显示出互补的优势。人工验证表明,PEBench 分数与专家对来自 Wan3.0 和 MiniMax-H3 的增强提示和下游视频的判断非常一致,表明提示级别的评估可靠地反映了下游效用。