论文
CLIP-CC-Bench:评估视频语言模型中的段落级视频描述
CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models
摘要
视频语言模型的基准测试主要集中在短片和单句指标上,目前的系统是否能够生成准确的长篇段落级描述尚不确定。我们推出了 CLIP-CC-Bench,这是一个用于长视频描述的评估套件,由 5 小时的电影内容分割成 90 秒的剪辑组成,每个剪辑都配有专家编写的段落样式参考。该评估套件采用五个最先进的基于 LLM 的嵌入模型的集合来提高可靠性并减轻单模型偏差,并应用两种互补的方法:(i) 粗粒度语义匹配和 (ii) 细粒度语义匹配,以将模型生成的描述与 CLIP-CC-Bench 参考进行比较。使用这个框架,我们评估了 17 个最先进的视频语言模型,并报告了它们的 Borda 聚合排名和 CLIP-CC-Bench 上的平均分数。我们通过法官间协议和引导排名稳定性进一步量化协议的内部可靠性。我们在 https://github.com/Multimodal-Intelligence-Lab/CLIP-CC-Bench 发布了标准化评估脚本、模型输出和聚合工具,以支持可重复性。 CLIP-CC-Bench 为长视频描述提供了实用的评估框架,填补了现有短视频和仅 QA 基准测试留下的空白。