论文
MEDit-Bench:用于评估消息驱动的叙事视频编辑的数据集
MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing
摘要
视频编辑从根本上来说是消息驱动的:即使来自相同的源镜头,所选镜头也会根据编辑器希望传达的叙述而变化。密切相关的任务(视频摘要)的基准将编辑意图简化为单一的、与消息无关的显着性概念,因此没有考虑到这种多样性。为了评估消息驱动的视频编辑,我们提出了 \textbf{MEDit-Bench},这是一个数据集和基准,它将长视频与多个编辑消息以及每条消息的多个专业制作的编辑配对,证明不同的消息会从同一来源产生截然不同的编辑。我们定义了一个基于时间对齐指标的自动评估协议,并发现 LLM 作为法官的偏好(叙事质量的自然代理)由于严重的位置偏差对于这项任务来说是不可靠的。我们还用歧义性和上下文分数来注释每条消息,并表明这两个维度与模型性能负相关,将消息难度确立为有意义的分层因素。使用最先进的 MLLM 和强化微调基线进行的实验表明,虽然强大的模型在宽松的阈值下接近人类时间对齐,但所有模型在更严格的标准下都落后于人类。人类感知研究进一步证实了巨大的质量差距,专业的人类编辑始终优于模型输出。