论文
测试字幕:通过多项选择题问答评估视频字幕质量
Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering
摘要
评估视频字幕仍然是 Visual 大语言模型 (VLLM) 的一项关键挑战。现有指标主要依赖于将生成的文本与 真值 引用进行匹配。这种范例受到视频描述的“一对多”性质的影响,其中高质量的字幕经常会因词汇不匹配或视觉焦点的有效转移而受到惩罚。此外,此类评估通常是一维的,无法提供对字幕质量的细粒度分析。为了解决这个问题,我们从信息保真度的角度重新定义字幕质量:字幕必须最大限度地覆盖显着的视觉信息,同时确保严格的真实性。我们推出了 CapQuiz,这是一种新颖的无参考基准,它根据字幕在回答从视频中得出的经过人工验证的细粒度多项选择问题的效用来评估字幕。 CapQuiz 采用分层分类法,涵盖 24 个不同视频领域的 10 种问题类型(涵盖描述性和推理性类别)。大量实验表明,与现有指标相比,CapQuiz 与人类判断的相关性明显更好,并提供了对模型性能的可解释的见解。