论文

AFDBench:用于国家天气服务预报讨论的推理第一人工智能科学家

AFDBench: A Reasoning-First AI Scientist for NationalWeather Service Forecast Discussions

模型评测基准与评测资源

摘要

大语言模型 (LLM) 在生成高风险气象文本时会产生幻觉数值,给天气通信带来风险。我们介绍 AFDBench,一位 AI 气象学家,通过对来自 Google WeatherNext 2 的结构化 AI 天气预报数据进行推理,生成专业的区域预报讨论 (AFD)。我们介绍 AFDBench,这是第一个评估生成气象推理的基准,包括来自 13 个国家气象局 (NWS) 办公室的 7,732 份专家书面讨论,搭配真实的 AI 天气预报输入,以及三个补充指标:Met-Align(数值准确性)、Style-Align (专业方言遵守)和输入依据对齐(对源天气数据的保真度)。零样本评估表明,开源 LLM 实现了较低的 Style-Align (~0.33) 和中等的 Input-Grounding (~0.88),未能写入专业 NWS 寄存器或忠实使用其输入数据。我们应用组相对策略优化 (GRPO) 和针对温度准确性、天气正确性和格式合规性的特定领域奖励。在来自两个看不见的 NWS 办公室的 1,033 个保留样本中,GRPO 将 Style-Align 从 0.318 提高到 0.619,并将输入依据对齐从 0.881 提高到 0.940,这表明强化学习可以教会 7B 参数模型像专业气象学家一样编写并忠实地解释 AI 天气数据。