论文
从密码本到 VLM:评估社交媒体上气候变化的自动视觉话语分析
From Codebooks to VLMs: Evaluating Automated Visual Discourse Analysis for Climate Change on Social Media
摘要
社交媒体平台已成为气候传播的主要场所,产生数以百万计的图像和帖子,如果进行系统分析,可以揭示哪些传播策略调动了公众的关注,哪些传播策略失败了。我们的目标是通过分析计算机视觉方法如何用于社交媒体话语分析来促进此类研究。该分析包括基于应用程序的分类设计、模型选择、提示工程和验证。我们在 X(以前称为 Twitter)的两个数据集上对 6 个可提示的视觉语言模型和 15 个零样本 CLIP 模型进行了基准测试 - 一个包含 1,038 张图像的专家注释集和一个包含超过 120 万张图像的更大语料库,其中有 50,000 个手动验证的标签 - 跨越五个注释维度:动物内容、气候变化后果、气候行动、图像设置和图像类型。在基准模型中,Gemini-3.1-flash-lite 在所有超级类别和两个数据集上都优于所有其他模型,而与中等大小的开放权重模型的差距仍然相对较小。除了实例级指标之外,我们还提倡分布式评估:即使每张图像的准确性适中,VLM 预测也可以可靠地恢复总体水平趋势,这使它们成为大规模话语分析的可行起点。我们发现,思想链推理会降低而不是提高性能,而注释维度特定的提示设计会提高性能。我们在 https://github.com/KathPra/Codebooks2VLMs.git 上发布了推文 ID 和标签以及我们的代码。