论文
ClimateVID——社交媒体视频分析和涉及的挑战
ClimateVID -- Social Media Videos Analysis and Challenges Involved
摘要
数字内容的普遍增长,特别是社交媒体平台上的短视频,极大地改变了公共话语中讨论和理解主题的方式。在这项工作中,我们通过评估社交媒体数据的零样本和聚类能力来推进自动视觉主题检测。 (1) 我们使用零样本图像分类评估了 VideoChatGPT、PandaGPT 和 VideoLLava 等著名 VLM 的功能,并将其性能与逐帧 CLIP 图像分类提供的基线进行了比较。 (2) 通过将聚类视为最小成本多切割问题,我们的目标是以无监督的方式发现有洞察力的模式。对于这两种分析策略,我们为从业者提供广泛的评估和实践指导。虽然 VLM 目前无法检测气候变化特定类别,但聚类结果是不同的视觉框架。 %鉴于VLM目前无法掌握气候变化话语,我们重点关注图像嵌入模型的聚类评估。我们发现 ConvNeXt V2 和 DINOv2 都产生有意义的集群,DINOv2 更关注风格差异和抽象类别,而 ConvNeXt V2 集群在更细粒度的方面有所不同。代码可在 https://github.com/KathPra/ClimateVID.git 获取。