论文

OmniVBench:用于 Omni 视频参考生成的基准和大规模数据集

OmniVBench: A Benchmark and Large-Scale Dataset for Omni Reference-to-Video Generation

模型评测基准与评测资源

摘要

视频参考 (R2V) 生成正朝着日益通用和多功能的参考控制方向发展,从而催生了全向 R2V 生成的新兴范例。然而,现有的基准测试缺乏这些新兴功能:它们的测试用例涵盖有限的参考类型和组成,并且它们的评估协议主要评估整体参考一致性,而忽略了参考因素是否得到正确保留、解开和路由。同时,构建全向R2V训练数据的成本高昂,导致合适的训练资源稀缺。为了解决这些差距,我们引入了 OmniVBench 和 Omni-R2V 数据集来评估和训练 Omni R2V 模型。 OmniVBench 将 R2V 评估扩展到更广泛的参考类型、细粒度控制任务和更丰富的参考组合,涵盖 7 个任务系列和 18 个细粒度任务,涵盖内容、动作、风格、结构、叙述和多参考设置。我们引入基于因素的评估,包含 12,172 个具体案例的检查表项目,评估预期的参考因素是否忠实保留、正确解开并与其目标绑定,并根据指示正确实现。我们进一步推出 Omni-R2V 数据集,为更广泛的研究社区带来各种 R2V 任务的工业级训练资源。它主要利用大规模的专业视频素材库,包含 340K 个经过处理的训练样本,涵盖不同的参考类型和多参考组合。我们开发用于参考目标对构建的特定于任务的管道,为全 R2V 数据构建提供实用且可扩展的配方。对先进开源和闭源 R2V 模型的广泛评估揭示了 OmniVBench 上任务系列和评估维度之间明显的性能差距,凸显了当前 R2V 模型的剩余局限性。