论文
评估新闻视频自动描述中开源视频 大语言模型 的基准方法
A Benchmarking Methodology to Assess Open-Source Video Large Language Models in Automatic Captioning of News Videos
摘要
新闻视频是电视台和在线流媒体平台制作的最流行的内容类型之一,但生成文本描述以促进索引和检索在很大程度上仍然是手动过程。视频 大语言模型 (VidLLM) 为自动化这项任务提供了巨大的潜力,但仍然缺乏新闻领域的全面评估。这项工作对八个用于自动新闻视频描述的最先进的开源 VidLLM 进行了比较研究,并在两个互补的基准数据集上进行了评估:智利电视新闻语料库(约 1,345 个剪辑)和 BBC 新闻语料库(9,838 个剪辑)。我们采用词汇度量(METEOR、ROUGE-L)、语义度量(BERTScore、CLIPScore、文本相似度、平均倒数排序)以及本工作中提出的两种新颖的保真度度量:主题保真度得分(TFS)和实体保真度得分(EFS)。我们的分析表明,由于表面形式依赖性、静态帧不敏感性和功能词膨胀,标准指标对新闻视频描述的区分能力有限。 TFS 和 EFS 通过直接评估生成的说明中的主题结构保留和命名实体覆盖率来解决这些差距。结果表明,Gemma~3 在两个数据集和大多数评估维度上均取得了最高的整体性能,Qwen-VL 始终稳居亚军。