论文

MMClima:多模式气候科学数据和评估框架

MMClima: A Framework for Multimodal Climate Science Data and Evaluation

模型评测基准与评测资源

摘要

气候变化研究越来越需要能够跨文本、动态视觉内容和科学数据进行推理的人工智能系统,但现有的气候质量保证基准规模很小,大部分是文本,并且覆盖的模型范围很窄。我们推出 MMClima,这是一个大型多模式气候问答框架,拥有超过 104,000 个经过专家验证的问答对,涵盖五个核心气候科学领域的文章、视频转录和图表。 MMClima 通过自动声明提取和 QA 合成以及人机交互验证来构建,以确保规模和可靠性。使用 MMClima,我们在需要事实回忆、视觉解释和跨模态合成的任务上对最先进的多模态语言模型进行基准测试。我们还对文本分割进行微调,以生成 mmclima-70b-txt,这是一个适应领域的基线,在文本 QA 方面优于强大的开源和闭源模型。我们发布了数据集、评估流程、微调模型权重和数据创建框架,以支持气候科学的标准化多模式评估。