论文

SciExam:AI Agent能否从真实数据构建ENSO气候模型?

SciExam for ENSO: Can AI Agents Build Climate Models?

智能体系统应用与实践Agent任务评测科学研究

摘要

语言模型Agent越来越多地承担开放式科学研究,但其结果通常依据已知答案、评分准则或语言模型评审评分,而这些方式都无法判定新科学模型是否有效。厄尔尼诺—南方涛动AI科学考试(SciExam for ENSO)要求Agent从真实观测中构建ENSO的低阶随机模型。ENSO是年际气候变化的主要模式。在六小时预算内,Agent处理观测数据、编写自身诊断程序并冻结这些程序,随后只利用其反馈开发模型。隐藏评分程序检验模型是否再现ENSO统计特征、恢复未观测变量并预测留出年份,也对一个已发表模型采用相同评分方式。在12个Agent系统中,六个生成的模型得分高于已发表模型,主要来自更好的重建与预测。较强模型的简化形式分别与ENSO冷暖不对称性的一种竞争性解释相容,而这一仍有争议的问题并未在任务中提出。改变输入信息的受控实验表明,最佳系统的得分并非来自记住带日期的观测记录,所获信息也会影响模型的构建方式。因此,SciExam for ENSO能够评测没有已知答案的Agent科学研究,结果表明Agent已经可以构建具有竞争力的模型,其结构与科学家仍在讨论的问题有关。

SciExam:AI Agent能否从真实数据构建ENSO气候模型?:论文原图
图 2:ENSO SciExam 概述。给定背景材料、原始观察结果和参考论文,智能体在六小时的预算内完成三个阶段的工作:(A) 将观察结果处理为必须通过数据检查的指数,(B) 根据任务的科学指导编写自己的诊断结果,然后将其冻结,(C) 在重新运行这些诊断结果的同时开发模型。隐藏评分者评估最终模型的统计特性、动态一致性和预测技能,而不将分数返回给代理。对话具有说明性。