论文

K-MetBench:气象学专家推理、局部性和多模态细粒度评估的多维基准

K-MetBench: A Multi-Dimensional Benchmark for Fine-Grained Evaluation of Expert Reasoning, Locality, and Multimodality in Meteorology

模型评测基准与评测资源

摘要

由于缺乏基于权威来源的多维、专家级评估框架,韩国天气预报员实用(多模式)大语言模型 助手的开发受到阻碍。为了解决这个问题,我们引入了 K-MetBench,这是一个基于国家资格考试的诊断基准。它揭示了四个维度上的关键差距:专家对图表的视觉推理、通过专家验证的理由的逻辑有效性、韩国特定的地理文化理解以及细粒度的领域分析。我们对 55 个模型的评估揭示了在解释专门图表方面存在深刻的模态差距,以及模型在预测正确的情况下产生逻辑幻觉的推理差距。至关重要的是,韩国模型在当地环境中的表现明显优于更大的全球模型,这表明仅靠参数缩放无法解决文化依赖性。 K-MetBench 是开发可靠、具有文化意识的专家人工智能代理的路线图。该数据集可在 https://huggingface.co/datasets/soyeonbot/K-MetBench 获取。