论文
SynopticBench:评估视觉语言模型生成未来天气预报的讨论
SynopticBench: Evaluating Vision-Language Models on Generating Weather Forecast Discussions of the Future
摘要
视觉语言模型 (VLM) 的最新进展使得图像字幕、报告生成和视觉感知等大量复杂的多模态任务得到显着改进。然而,从气象数据生成文本非常具有挑战性,因为大气是一个混沌系统,在不同的空间和时间尺度上快速变化。鉴于大气现象的复杂性,可验证地量化现有 VLM 对天气预报数据的有效性至关重要。在这项工作中,我们提出了 SynopticBench,这是一个高质量的数据集,由国家气象局在美国大陆上创建的区域预报讨论的 1,367,041 个文本样本组成,并与天气预报中 500mb 位势高度、2 米温度和 850mb 风速的图像配对。我们还提出了天气现象对齐和覆盖评估(SPACE),这是一种新颖的评估框架,可用于有效评估天气现象文本描述的质量。使用最先进的 VLM 生成预测讨论的大量实验表明了该领域现有评估指标的敏感性,并使得能够进一步探索天气和气候文本生成。