论文

HydroAgent:通过基于模拟器的 RL 缩小水文模型校准前沿 LLM 与人类专家之间的差距

HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL

模型训练强化学习

摘要

校准分布式水文模型是水资源管理中的一个关键瓶颈——径流预测、水库运行、干旱监测、基础设施设计和洪水预报都依赖于它。每个流域都需要专家将水文特征转换为高维参数向量的调整,并且生成的工作流程不会在流域之间转移。我们问:前沿大语言模型(LLM)代理可以取代人类水文建模师吗?如果不能,需要什么?我们在美国国家气象局用于山洪预报的业务 CREST 分布式水文模型上对九个前沿 LLM 代理(Claude Opus 4.6/4.7、Sonnet 4.6、GPT-5/5.4/5.4-pro 和 Gemini 2.5-pro/3.1-pro/3-flash)进行了基准测试。横跨 329-40,792 km2 的四个保留仪表的二十轮最佳纳什-萨克利夫效率 (NSE) 范围从 -0.16 (GPT-5.4) 到 0.75 (Sonnet 4.6);上限在所有三个供应商和能力层中重现,最强的模型集中在 0.65-0.75 范围内,除了 Opus-4.7 之外,没有任何模型在一个指标上达到人类专家参考值。我们认为这种差距不是参数计数问题,而是领域基础问题。然后,我们提出了 HYDROAGENT、微调 开放权重 Qwen3-4B,并在 2,576 个专家校准轨迹上使用有监督的 微调 和使用 NSE 作为来自在线 CREST 模拟的可验证奖励的组相对策略优化 - 带有模拟反馈的强化学习(RLSF)。对于地球系统科学来说,与扩展通用前沿模型相比,采用循环模拟器强化学习的小型域调整策略是一种计算效率更高、物理上更可靠的路径,而地球数据的多模态丰富性(遥感、现场时间序列和预报器叙述)使域代理成为物理科学中人工智能的杠杆方向。