论文

基于执行的评估揭示了环境科学语言模型计算中隐藏的失败

Execution-grounded evaluation reveals hidden failures in language-model calculations for environmental science

模型评测基准与评测资源

摘要

大语言模型 越来越多地用于环境科学中的定量工作,但现有的评估仅对最终答案进行评分,而计算过程未被观察到。这里我们介绍AtmosCoder-Bench,一个以执行为基础的基准测试,使计算过程可视化。通过可转移的半自动化管道(436 个问题、3,910 个变体、7,029 个分级数量)构建,每个问题都经过验证,明确且可人工解决,并具有唯一可验证的答案。我们发现 (i) 多项选择格式将测量准确度提高至少 12 个百分点; (ii) 许多失败不是由于知识缺失引起的,而是由于模型未能在整个多步骤计算中一致地应用已知公式和约束; (iii) 当特定任务的条件使熟悉的方法无效时,即使是前沿模型也仍然很薄弱,通常会恢复到规范的解决方案模式,而不是使方法适应相关的物理状况,因此专家监督至关重要。