论文
QEVA:多模态问答叙事视频摘要的无参考评估指标
QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering
摘要
视频到文本摘要在综合评估方法方面仍待探索。传统的基于 n-gram 重叠的度量和最近基于 大语言模型 (LLM) 的方法严重依赖于人类编写的参考摘要,限制了它们的实用性和对细微语义方面的敏感性。在本文中,我们提出了 QEVA,这是一种无参考指标,通过多模态问答直接针对源视频评估候选摘要。 QEVA 从三个明确的维度评估摘要:覆盖范围、事实性和时间顺序。我们还引入了 MLVU(VS)-Eval,这是一种源自 MLVU 数据集的新带注释基准,其中包含使用最先进的视频语言多模态模型从 200 个视频生成的 800 个摘要。该数据集建立了一个透明且一致的评估框架。实验结果表明,与现有方法相比,QEVA 显示出与人类判断更高的相关性(通过 Kendall 的 $τ_b$、$τ_c$ 和 Spearman 的 $ρ$ 进行测量)。我们希望我们的基准和指标将促进视频到文本摘要研究取得有意义的进展,并为未来评估方法的开发提供有价值的见解。