论文

KISS:面向科学仿真的知识基础设施——智能体地球科学的脚手架

KISS - Knowledge Infrastructure for Scientific Simulation: A Scaffolding for Agentic Earth Science

应用与实践智能体系统Agent Harness科学研究

摘要

基于过程的仿真模型凝结了地球科学领域数十年积累的科学认知,然而最受气候风险与资源短缺影响的群体却最缺乏使用它们的能力。在此,我们提出知识基础设施(KI),一个可供智能体使用的脚手架,把专业知识外化为经过验证的建模算子、分阶段的领域协议与诊断恢复机制。在3000次试验的耦合水文基准上,配备KI的智能体在最多84%的试验中产出了物理上合理、可验证的端到端仿真,而没有KI的智能体则停滞在40%以下。KI能够跨学科泛化。我们将其构建过程封装为知识解剖工具包(KDT),其自主产出的KI使智能体能够端到端执行横跨14个地球科学领域的另外117个基于过程的模型。纵观全部119个KI,尽管底层物理各不相同,建模决策与失败补救方案却趋于收敛,这表明操作性专业知识是结构化、可提取的,而非临时拼凑。演示表明,配备KI的智能体既降低了非专业用户与基于过程仿真之间的使用门槛,也降低了建模社区之间的整合壁垒。借助这一脚手架,基于过程的科学得以作为一个鲜活的科学公地而演进:响应每一个需要了解它的人,并由每一个能够贡献的人来扩展。

KISS:面向科学仿真的知识基础设施——智能体地球科学的脚手架:论文配图
图 1:知识基础设施从深度到规模进行评估。 (a):规模。横跨 14 个地球科学领域的 119 个基于流程的模型的 KI 构建和验证测试了是否可以在单个手工编写的工作流程之外构建支架。每列代表一个模型,根据其 KI 验证的深度进行着色。深蓝色 (n=2n=2):VIC 和 Lohmann 路由,在面板 a 所示的多代理 3,000 试验协议下手工构建和测试。中蓝色 (n=25n=25):高置信度传输集,在专家监督下构建,并在三个不同地理位置的站点进行验证,每个站点运行三个独立代理。浅蓝色 (n=59n=59):缩放集的观察验证部分,由知识剖析工具包 (KDT) 完全自主构建,并通过在三个站点针对独立观察数据运行的三个独立代理进行验证。最浅的蓝色 (n=33n=33):缩放集的仅可运行部分,在源代码提供的合成、示例或分析输入上自主构建并验证可运行。 (b):KI 的深度测试。 3,000 次试验的多智能体基准测试测试了完整的 VIC–Lohmann KI 包是否允许来自五个独立平台(Anthropic、OpenAI、Google、Moonshot、阿里巴巴)的 10 个 CLI 编码智能体在三个淮河流域可靠地运行工作流程(每个流域每个智能体 100 次试验)。每个点代表一个代理,按中位完成时间(x 轴)和总体成功率(y 轴)定位。虚线表示事后分配的经验绩效等级:第 1 级 (≥80%\geq 80\%)、第 2 级 (40–80%) 和第 3 级 (<40%<40\%)。仅当代理完成所有 14 个管道里程碑并生成 Nash-Sutcliffe 效率≥0.2\geq 0.2 的排放模拟时,试验才被评为成功。