论文

SemComp-Bench:视频生成中语义任务完成的基准测试

SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation

模型评测基准与评测资源

摘要

我们引入语义任务完成视频生成,这是一种面向结果的视频生成任务。根据这种表述,成功需要实现预期结果和语义基础。语义基础根据与任务相关的高级语义来表征参考图像和生成的结果之间的对应关系。评估侧重于生成的结果,既不需要呈现中间任务步骤的完整序列,也不需要与参考图像的传统外观一致性。为了支持系统评估,我们构建了 SemComp-Data,一个涵盖六个领域的评估数据集。每个实例都包含参考图像、详细说明、简要说明和以结果为中心的视频剪辑。可扩展的四阶段管理管道将原始视频转换为标准化的 SemComp-Data 实例。我们进一步介绍了 SemComp-Bench,这是一种使用视觉语言模型(VLM)来回答结构化二进制问题的评估协议。 SemComp-Bench 分别报告成果成就和生成可靠性的 OA 分数和 GR 分数。对代表性视频生成模型的实验表明,在保持参考图像中与任务相关的语义基础的同时实现预期结果仍然具有挑战性。